Trang chủ/Tài liệu
API Llama: Yêu cầu đầu tiên trong năm phút
Nhận phản hồi đầu tiên từ LLM không kiểm duyệt trong dưới năm phút. Hướng dẫn nhanh này cho bạn cách thay thế cấu hình client OpenAI hiện tại bằng base URL và khóa API của chúng tôi.
https://api.llamaapis.com/v1uncensored
Cài đặt
Bắt đầu bằng cách cài đặt client Python chính thức của OpenAI. Nó xử lý các yêu cầu HTTP và phân tích JSON cho bạn.
- pip install openai
Bạn cũng có thể sử dụng SDK JavaScript cho Node.js. Cả hai thư viện đều tương thích hoàn toàn với API của chúng tôi vì chúng tôi tuân thủ chính xác thông số chat-completions của OpenAI.
Thiết lập xác thực
API của chúng tôi sử dụng xác thực khóa API tiêu chuẩn. Sau khi đăng ký tại https://llamaapis.com, bạn sẽ nhận được khóa ngay lập tức. Không cần thẻ tín dụng cho gói dùng thử.
Lưu khóa này trong biến môi trường hoặc truyền trực tiếp vào client của bạn. Khóa xác thực tất cả các yêu cầu đến các endpoint /v1. Nếu bạn mất khóa, bạn có thể tạo lại từ bảng điều khiển, điều này vô hiệu hóa khóa cũ ngay lập tức.
Yêu cầu hoàn thành trò chuyện cơ bản
Thực hiện yêu cầu đến endpoint hoàn thành trò chuyện. Bạn phải đặt base URL thành máy chủ của chúng tôi và cung cấp khóa API của bạn.
ID của mô hình là uncensored. Mô hình này không áp dụng các bộ lọc nội dung tiêu chuẩn cho mục đích sử dụng người trưởng thành hợp pháp.
Dưới đây là cách bạn thực hiện một yêu cầu đơn giản bằng curl:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Phản hồi trả về một chuỗi văn bản được tạo. Nếu bạn cần gọi hàm, cấu trúc giống hệt với định dạng của OpenAI.
Phản hồi truyền phát (SSE)
Để xuất đầu ra thời gian thực, hãy bật truyền phát bằng cách đặt stream: true. Máy chủ gửi các sự kiện đã gửi máy chủ (SSE) chứa các phần delta.
Điều này hữu ích cho các giao diện trò chuyện nơi bạn muốn hiển thị văn bản khi nó được tạo. Cửa sổ ngữ cảnh hỗ trợ tối đa 100.000 token, vì vậy truyền phát hoạt động hiệu quả ngay cả với các cuộc trò chuyện dài.
Ví dụ triển khai truyền phát:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Hãy nhớ xử lý sự kiện stop để đóng kết nối một cách sạch sẽ.
Hỗ trợ gọi công cụ/hàm
API của chúng tôi hỗ trợ gọi công cụ có cấu trúc. Xác định các hàm của bạn trong tham số tools và đặt mô hình phản hồi bằng các lệnh gọi hàm.
Thư viện client sẽ tự động phân tích các đối số JSON. Điều này hoạt động chính xác như được ghi lại trong thông số OpenAI.
Ví dụ sử dụng SDK Python:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Mô hình sẽ trả về tên hàm và các đối số. Bạn thực thi hàm và gửi kết quả lại trong tin nhắn tiếp theo.
Giới hạn, Lỗi và Ngữ cảnh
Hãy lưu ý các giới hạn sau:
- Giới hạn tốc độ: 300 yêu cầu mỗi phút mỗi khóa API.
- Kích thước tối đa của thân yêu cầu: 8 MB.
- Cửa sổ ngữ cảnh: 100.000 token tổng cộng (đầu vào + đầu ra).
Lỗi phổ biến:
- 401 Không được ủy quyền: Khóa API không hợp lệ hoặc bị thiếu.
- 402 Yêu cầu thanh toán: Tín dụng trả trước không đủ.
- 429 Quá nhiều yêu cầu: Bạn đã vượt quá giới hạn 300 yêu cầu mỗi phút.
Chúng tôi không cung cấp embedding, tạo hình ảnh hoặc xử lý âm thanh. Đây là API LLM chỉ dành cho văn bản.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Thông số kỹ thuật
Toàn bộ giới hạn và tính năng thực tế của API ở một nơi — hãy kiểm tra trước khi nạp tiền.
| Mục | Giá trị |
|---|---|
| Định dạng | tương thích OpenAI: mọi SDK OpenAI đều chạy được, chỉ cần đổi base URL và khóa |
| Xác thực | Authorization: Bearer YOUR_KEY |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| ID mô hình | uncensored |
| Cửa sổ ngữ cảnh | 100.000 token (đầu vào + đầu ra) |
| Đầu ra tối đa | tối đa phần còn lại của cửa sổ 100.000 token; max_tokens tùy chọn (không giới hạn riêng) |
| Gọi hàm | có — tools, tool_choice; phản hồi có tool_calls, kể cả khi streaming; kết quả gửi lại bằng role: tool |
| Chế độ JSON | response_format: {"type": "json_object"} |
| Tham số | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | có — server-sent events; phần cuối chứa lượng token đã dùng |
| Giới hạn tốc độ | 300 yêu cầu mỗi phút cho mỗi khóa |
| Yêu cầu đồng thời | tối đa 8 cùng lúc cho mỗi khóa |
| Kích thước yêu cầu | tối đa 8 MB |
| Header phản hồi | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Thưởng | +5% từ $50, +10% từ $100 |
| Giá | $0,25 cho 1 triệu token đầu vào · $1,00 cho 1 triệu token đầu ra |
| Tính phí | tín dụng trả trước theo mức dùng thực tế; lỗi và từ chối miễn phí |
| Nạp tiền | USDT (TRC20) hoặc USDC (Base), số tiền nguyên bất kỳ từ $10 đến $500 |
| Thời hạn | tín dụng đã trả không hết hạn, không đăng ký định kỳ |
| Dùng thử miễn phí | $0,50 trong 7 ngày, không cần thẻ · Khóa dùng thử: 2 yêu cầu song song, 60 yêu cầu/phút; hạn mức đầy đủ (8 và 300) sau lần nạp đầu |
| Khóa | mỗi tài khoản một khóa đang hoạt động; khóa mới thay thế khóa cũ |
| Nội dung | cho phép nội dung người lớn; từ chối nội dung tình dục liên quan đến trẻ vị thành niên |
| Đăng nhập | Google hoặc email và mật khẩu |
Mã lỗi
Lỗi trả về dạng JSON với type cố định; yêu cầu lỗi hoặc bị từ chối không bị tính phí.
| Mã | Loại | Ý nghĩa |
|---|---|---|
400 | bad_request | JSON sai, tin nhắn trống, tham số sai hoặc vượt cửa sổ ngữ cảnh |
401 | missing_key · invalid_key · key_revoked | thiếu khóa, sai khóa hoặc khóa đã bị thay |
402 | no_credit | hết tín dụng — nạp tiền là dùng tiếp ngay |
403 | content_blocked | nội dung tình dục liên quan trẻ vị thành niên — từ chối, không tính phí |
404 | not_found | endpoint không tồn tại |
413 | request_too_large | nội dung lớn hơn 8 MB |
429 | rate_limited · concurrency | vượt 300/phút hoặc 8 đồng thời — chờ rồi thử lại |
503 | upstream_busy | mô hình đang bận — thử lại sau vài giây |
Hỏi đáp
Điều gì xảy ra nếu tôi vượt quá tín dụng trả trước?
Yêu cầu của bạn sẽ nhận lỗi 402 cho đến khi bạn nạp tiền vào tài khoản. Bạn có thể thêm tín dụng qua tiền điện tử (USDT hoặc USDC) bắt đầu từ $10. Tín dụng trả trước hiện có không bao giờ hết hạn.
Mô hình không kiểm duyệt này đã được tinh chỉnh hay là mô hình gốc?
Đây là mô hình trọng số mở chạy trên máy chủ GPU của riêng chúng tôi, được tinh chỉnh đặc biệt để trả lời mà không từ chối nội dung cho mục đích người trưởng thành hợp pháp. Nó không phải là bản sao trực tiếp của GPT hay Claude.
Tôi có thể sử dụng cùng mã SDK với OpenAI không?
Có. Thay đổi <code>base_url</code> thành <code>https://api.llamaapis.com/v1</code> và cập nhật khóa API. Định dạng yêu cầu và phản hồi tương thích.
Khóa của bạn chỉ cách một biểu mẫu
Tạo tài khoản, sao chép khóa, thay đổi base URL. Đó là toàn bộ thiết lập.