VI ▾
Lấy khóa API

Trang chủTài liệu

API Llama: Yêu cầu đầu tiên trong năm phút

Nhận phản hồi đầu tiên từ LLM không kiểm duyệt trong dưới năm phút. Hướng dẫn nhanh này cho bạn cách thay thế cấu hình client OpenAI hiện tại bằng base URL và khóa API của chúng tôi.

https://api.llamaapis.com/v1uncensored

llamaapis.com

Cài đặt

Bắt đầu bằng cách cài đặt client Python chính thức của OpenAI. Nó xử lý các yêu cầu HTTP và phân tích JSON cho bạn.

  • pip install openai

Bạn cũng có thể sử dụng SDK JavaScript cho Node.js. Cả hai thư viện đều tương thích hoàn toàn với API của chúng tôi vì chúng tôi tuân thủ chính xác thông số chat-completions của OpenAI.

Thiết lập xác thực

API của chúng tôi sử dụng xác thực khóa API tiêu chuẩn. Sau khi đăng ký tại https://llamaapis.com, bạn sẽ nhận được khóa ngay lập tức. Không cần thẻ tín dụng cho gói dùng thử.

Lưu khóa này trong biến môi trường hoặc truyền trực tiếp vào client của bạn. Khóa xác thực tất cả các yêu cầu đến các endpoint /v1. Nếu bạn mất khóa, bạn có thể tạo lại từ bảng điều khiển, điều này vô hiệu hóa khóa cũ ngay lập tức.

Yêu cầu hoàn thành trò chuyện cơ bản

Thực hiện yêu cầu đến endpoint hoàn thành trò chuyện. Bạn phải đặt base URL thành máy chủ của chúng tôi và cung cấp khóa API của bạn.

ID của mô hình là uncensored. Mô hình này không áp dụng các bộ lọc nội dung tiêu chuẩn cho mục đích sử dụng người trưởng thành hợp pháp.

Dưới đây là cách bạn thực hiện một yêu cầu đơn giản bằng curl:

curl https://api.llamaapis.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Phản hồi trả về một chuỗi văn bản được tạo. Nếu bạn cần gọi hàm, cấu trúc giống hệt với định dạng của OpenAI.

Phản hồi truyền phát (SSE)

Để xuất đầu ra thời gian thực, hãy bật truyền phát bằng cách đặt stream: true. Máy chủ gửi các sự kiện đã gửi máy chủ (SSE) chứa các phần delta.

Điều này hữu ích cho các giao diện trò chuyện nơi bạn muốn hiển thị văn bản khi nó được tạo. Cửa sổ ngữ cảnh hỗ trợ tối đa 100.000 token, vì vậy truyền phát hoạt động hiệu quả ngay cả với các cuộc trò chuyện dài.

Ví dụ triển khai truyền phát:

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Hãy nhớ xử lý sự kiện stop để đóng kết nối một cách sạch sẽ.

Hỗ trợ gọi công cụ/hàm

API của chúng tôi hỗ trợ gọi công cụ có cấu trúc. Xác định các hàm của bạn trong tham số tools và đặt mô hình phản hồi bằng các lệnh gọi hàm.

Thư viện client sẽ tự động phân tích các đối số JSON. Điều này hoạt động chính xác như được ghi lại trong thông số OpenAI.

Ví dụ sử dụng SDK Python:

from openai import OpenAI

client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Mô hình sẽ trả về tên hàm và các đối số. Bạn thực thi hàm và gửi kết quả lại trong tin nhắn tiếp theo.

Giới hạn, Lỗi và Ngữ cảnh

Hãy lưu ý các giới hạn sau:

  • Giới hạn tốc độ: 300 yêu cầu mỗi phút mỗi khóa API.
  • Kích thước tối đa của thân yêu cầu: 8 MB.
  • Cửa sổ ngữ cảnh: 100.000 token tổng cộng (đầu vào + đầu ra).

Lỗi phổ biến:

  • 401 Không được ủy quyền: Khóa API không hợp lệ hoặc bị thiếu.
  • 402 Yêu cầu thanh toán: Tín dụng trả trước không đủ.
  • 429 Quá nhiều yêu cầu: Bạn đã vượt quá giới hạn 300 yêu cầu mỗi phút.

Chúng tôi không cung cấp embedding, tạo hình ảnh hoặc xử lý âm thanh. Đây là API LLM chỉ dành cho văn bản.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Thông số kỹ thuật

Toàn bộ giới hạn và tính năng thực tế của API ở một nơi — hãy kiểm tra trước khi nạp tiền.

MụcGiá trị
Định dạngtương thích OpenAI: mọi SDK OpenAI đều chạy được, chỉ cần đổi base URL và khóa
Xác thựcAuthorization: Bearer YOUR_KEY
EndpointPOST /v1/chat/completions · GET /v1/models
Base URLhttps://api.llamaapis.com/v1
ID mô hìnhuncensored
Cửa sổ ngữ cảnh100.000 token (đầu vào + đầu ra)
Đầu ra tối đatối đa phần còn lại của cửa sổ 100.000 token; max_tokens tùy chọn (không giới hạn riêng)
Gọi hàmcó — tools, tool_choice; phản hồi có tool_calls, kể cả khi streaming; kết quả gửi lại bằng role: tool
Chế độ JSONresponse_format: {"type": "json_object"}
Tham sốtemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingcó — server-sent events; phần cuối chứa lượng token đã dùng
Giới hạn tốc độ300 yêu cầu mỗi phút cho mỗi khóa
Yêu cầu đồng thờitối đa 8 cùng lúc cho mỗi khóa
Kích thước yêu cầutối đa 8 MB
Header phản hồiX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Thưởng+5% từ $50, +10% từ $100
Giá$0,25 cho 1 triệu token đầu vào · $1,00 cho 1 triệu token đầu ra
Tính phítín dụng trả trước theo mức dùng thực tế; lỗi và từ chối miễn phí
Nạp tiềnUSDT (TRC20) hoặc USDC (Base), số tiền nguyên bất kỳ từ $10 đến $500
Thời hạntín dụng đã trả không hết hạn, không đăng ký định kỳ
Dùng thử miễn phí$0,50 trong 7 ngày, không cần thẻ · Khóa dùng thử: 2 yêu cầu song song, 60 yêu cầu/phút; hạn mức đầy đủ (8 và 300) sau lần nạp đầu
Khóamỗi tài khoản một khóa đang hoạt động; khóa mới thay thế khóa cũ
Nội dungcho phép nội dung người lớn; từ chối nội dung tình dục liên quan đến trẻ vị thành niên
Đăng nhậpGoogle hoặc email và mật khẩu

Mã lỗi

Lỗi trả về dạng JSON với type cố định; yêu cầu lỗi hoặc bị từ chối không bị tính phí.

MãLoạiÝ nghĩa
400bad_requestJSON sai, tin nhắn trống, tham số sai hoặc vượt cửa sổ ngữ cảnh
401missing_key · invalid_key · key_revokedthiếu khóa, sai khóa hoặc khóa đã bị thay
402no_credithết tín dụng — nạp tiền là dùng tiếp ngay
403content_blockednội dung tình dục liên quan trẻ vị thành niên — từ chối, không tính phí
404not_foundendpoint không tồn tại
413request_too_largenội dung lớn hơn 8 MB
429rate_limited · concurrencyvượt 300/phút hoặc 8 đồng thời — chờ rồi thử lại
503upstream_busymô hình đang bận — thử lại sau vài giây

Hỏi đáp

llamaapis.com
Điều gì xảy ra nếu tôi vượt quá tín dụng trả trước?

Yêu cầu của bạn sẽ nhận lỗi 402 cho đến khi bạn nạp tiền vào tài khoản. Bạn có thể thêm tín dụng qua tiền điện tử (USDT hoặc USDC) bắt đầu từ $10. Tín dụng trả trước hiện có không bao giờ hết hạn.

Mô hình không kiểm duyệt này đã được tinh chỉnh hay là mô hình gốc?

Đây là mô hình trọng số mở chạy trên máy chủ GPU của riêng chúng tôi, được tinh chỉnh đặc biệt để trả lời mà không từ chối nội dung cho mục đích người trưởng thành hợp pháp. Nó không phải là bản sao trực tiếp của GPT hay Claude.

Tôi có thể sử dụng cùng mã SDK với OpenAI không?

Có. Thay đổi <code>base_url</code> thành <code>https://api.llamaapis.com/v1</code> và cập nhật khóa API. Định dạng yêu cầu và phản hồi tương thích.

Khóa của bạn chỉ cách một biểu mẫu

Tạo tài khoản, sao chép khóa, thay đổi base URL. Đó là toàn bộ thiết lập.

Lấy khóa API