Главная/Документация
API Llama: первый запрос за пять минут
Получите первый ответ от LLM без цензуры менее чем за пять минут. Это руководство показывает, как заменить конфигурацию клиента OpenAI на наш базовый URL и API-ключ.
https://api.llamaapis.com/v1uncensored
Установка
Начните с установки официального клиента OpenAI для Python. Он обрабатывает HTTP-запросы и парсинг JSON за вас.
- pip install openai
Вы также можете использовать SDK для JavaScript для Node.js. Обе библиотеки полностью совместимы с нашим API, так как мы точно следуем спецификации chat-completions OpenAI.
Настройка аутентификации
Наш API использует стандартную аутентификацию по API-ключу. После входа на https://llamaapis.com вы сразу получаете ключ. Для пробного уровня не требуется кредитная карта.
Сохраните этот ключ в переменной окружения или передайте его напрямую клиенту. Ключ аутентифицирует все запросы к эндпоинтам /v1. Если вы потеряете ключ, вы можете сгенерировать новый в панели управления, что немедленно аннулирует старый.
Базовый запрос на завершение чата
Отправьте запрос на эндпоинт завершения чата. Вы должны установить базовый URL на наш сервер и предоставить API-ключ.
Идентификатор модели — uncensored. Эта модель не применяет стандартные фильтры контента для законного использования взрослыми.
Вот как сделать простой запрос с помощью curl:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'В ответе возвращается сгенерированная строка текста. Если вам нужен вызов функций, структура идентична формату OpenAI.
Потоковые ответы (SSE)
Для вывода в реальном времени включите потоковую передачу, установив stream: true. Сервер отправляет события Server-Sent Events (SSE), содержащие частичные дельты.
Это полезно для интерфейсов чата, где вы хотите показывать текст по мере его генерации. Контекстное окно поддерживает до 100 000 токенов, поэтому потоковая передача эффективно работает даже для длинных разговоров.
Пример реализации потоковой передачи:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Помните обрабатывать событие stop, чтобы корректно закрыть соединение.
Поддержка вызова инструментов/функций
Наш API поддерживает структурированный вызов функций. Определите свои функции в параметре tools и установите для модели режим ответа с помощью вызовов функций.
Библиотека клиента автоматически проанализирует аргументы JSON. Это работает точно так же, как описано в спецификации OpenAI.
Пример с использованием SDK Python:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Модель вернет имя функции и аргументы. Вы выполняете функцию и отправляете результат обратно в следующем сообщении.
Лимиты, ошибки и контекст
Обратите внимание на следующие ограничения:
- Лимит запросов: 300 запросов в минуту на один API-ключ.
- Максимальный размер тела запроса: 8 МБ.
- Контекстное окно: 100 000 токенов всего (ввод + вывод).
Распространенные ошибки:
- 401 Unauthorized: Неверный или отсутствующий API-ключ.
- 402 Payment Required: Недостаточно предоплаченного кредита.
- 429 Too Many Requests: Вы превысили лимит 300 rpm.
Мы не предоставляем эмбеддинги, генерацию изображений или обработку аудио. Это API только для текста.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Технические характеристики
Все реальные лимиты и возможности API в одном месте — сверьте их до пополнения.
| Параметр | Значение |
|---|---|
| Формат API | совместим с OpenAI: любой OpenAI SDK работает — замените base URL и ключ |
| Авторизация | Authorization: Bearer YOUR_KEY |
| Эндпоинты | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| ID модели | uncensored |
| Контекстное окно | 100 000 токенов (вход и ответ вместе) |
| Максимум ответа | до остатка окна в 100 000 токенов; max_tokens необязателен (отдельного лимита нет) |
| Вызов функций | да — tools, tool_choice; ответ содержит tool_calls, в том числе в потоке; результат — сообщением role: tool |
| JSON-режим | response_format: {"type": "json_object"} |
| Параметры | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Потоковая передача | да — server-sent events, последний фрагмент содержит расход токенов |
| Лимит запросов | 300 запросов в минуту на ключ |
| Параллельные запросы | до 8 одновременно на ключ |
| Размер запроса | до 8 МБ |
| Заголовки ответа | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Бонус | +5% от $50, +10% от $100 |
| Цена | $0,25 за 1 млн входных токенов · $1,00 за 1 млн выходных |
| Оплата | предоплаченный баланс по фактическому расходу; ошибки и отказы бесплатны |
| Пополнение | USDT (TRC20) или USDC (Base), любая целая сумма от $10 до $500 |
| Срок действия | оплаченный баланс не сгорает, без подписки |
| Пробный баланс | $0,50 на 7 дней, без карты · Пробный ключ: 2 параллельных запроса, 60 в минуту; полные лимиты (8 и 300) после первого пополнения |
| Ключи | один активный ключ на аккаунт; новый заменяет старый |
| Контент | контент для взрослых разрешён; сексуальный контент с несовершеннолетними запрещён |
| Вход | Google или e-mail и пароль |
Коды ошибок
Ошибки приходят в JSON с постоянным type; неудачные и отклонённые запросы не оплачиваются.
| Код | Тип | Что значит |
|---|---|---|
400 | bad_request | неверный JSON, пустые сообщения, неверный параметр или превышено окно контекста |
401 | missing_key · invalid_key · key_revoked | нет ключа, ключ неверный или заменён новым |
402 | no_credit | баланс пуст — пополните, работа продолжится сразу |
403 | content_blocked | сексуальный контент с несовершеннолетними — отказ, без оплаты |
404 | not_found | неизвестный эндпоинт |
413 | request_too_large | тело запроса больше 8 МБ |
429 | rate_limited · concurrency | больше 300/мин или 8 параллельно — подождите и повторите |
503 | upstream_busy | модель занята — повторите через несколько секунд |
Вопросы и ответы
Что произойдет, если я превышу лимит предоплаченного баланса?
Ваши запросы будут возвращать ошибку 402, пока вы не пополните аккаунт. Вы можете добавить кредит через криптовалюту (USDT или USDC) от $10. Существующий предоплаченный баланс не сгорает.
Модель без цензуры — это дообученная или базовая модель?
Это модель с открытыми весами, работающая на наших GPU-серверах. Она специально настроена для ответов без отказов по контенту для законного использования взрослыми. Это не прямая копия GPT или Claude.
Могу ли я использовать тот же код SDK, что и для OpenAI?
Да. Измените <code>base_url</code> на <code>https://api.llamaapis.com/v1</code> и обновите API-ключ. Форматы запроса и ответа совместимы.
Ваш ключ — в одной форме от вас
Создайте аккаунт, скопируйте ключ, измените базовый URL. Вот и вся настройка.