Início/Documentação
API Llama: primeira requisição em cinco minutos
Obtenha sua primeira resposta de um LLM sem censura em menos de cinco minutos. Este guia rápido mostra como substituir a configuração do cliente OpenAI existente pela nossa URL base e chave de API.
https://api.llamaapis.com/v1uncensored
Instalação
Comece instalando o cliente oficial OpenAI para Python. Ele cuida das requisições HTTP e análise JSON para você.
- pip install openai
Você também pode usar o SDK JavaScript para Node.js. Ambas as bibliotecas são totalmente compatíveis com nossa API porque seguimos a especificação de chat-completions da OpenAI exatamente.
Configuração de Autenticação
Nossa API usa autenticação padrão com chave de API. Após entrar em https://llamaapis.com, você recebe uma chave imediatamente. Nenhum cartão de crédito é necessário para o crédito de teste grátis.
Armazene esta chave em uma variável de ambiente ou passe-a diretamente para seu cliente. A chave autentica todas as requisições aos endpoints /v1. Se você perder sua chave, pode regenerá-la no seu painel, o que invalida a antiga imediatamente.
Requisição Básica de Chat
Faça uma requisição ao endpoint de conclusões de chat. Você deve definir o endpoint base para nosso servidor e fornecer sua chave de API.
O ID do modelo é uncensored. Este modelo não aplica filtros de conteúdo padrão para uso adulto lícito.
Veja como fazer uma requisição simples usando curl:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'A resposta retorna uma string de texto gerada. Se você precisar de chamada de funções, a estrutura é idêntica ao formato da OpenAI.
Respostas em Streaming (SSE)
Para saída em tempo real, ative o streaming definindo stream: true. O servidor envia Eventos Enviados pelo Servidor (SSE) contendo deltas parciais.
Isso é útil para interfaces de chat onde você deseja mostrar o texto conforme é gerado. A janela de contexto suporta até 100.000 tokens, então o streaming funciona eficientemente mesmo para conversas longas.
Exemplo de implementação em streaming:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Lembre-se de lidar com o evento stop para fechar a conexão limpidamente.
Suporte a Chamada de Ferramentas/Funções
Nossa API suporta chamada estruturada de ferramentas. Defina suas funções no parâmetro tools e defina o modelo para responder com chamadas de funções.
A biblioteca cliente analisará os argumentos JSON automaticamente. Isso funciona exatamente como documentado na especificação da OpenAI.
Exemplo usando o SDK Python:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)O modelo retornará o nome da função e os argumentos. Você executa a função e envia o resultado de volta na próxima mensagem.
Limites, Erros e Contexto
Esteja ciente dos seguintes limites:
- Limite de requisições: 300 requisições por minuto por chave de API.
- Corpo máximo da requisição: 8 MB.
- Janela de contexto: 100.000 tokens no total (entrada + saída).
Erros comuns:
- 401 Não Autorizado: Chave de API inválida ou ausente.
- 402 Pagamento Necessário: Crédito pré-pago insuficiente.
- 429 Muitas Requisições: Você excedeu o limite de 300 rpm.
Não oferecemos embeddings, geração de imagens ou processamento de áudio. Esta é uma API LLM apenas para texto.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Especificações técnicas
Todos os limites e recursos reais da API em um só lugar — confira antes de recarregar.
| Item | Valor |
|---|---|
| Formato | compatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave |
| Autenticação | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| ID do modelo | uncensored |
| Janela de contexto | 100.000 tokens (entrada + saída) |
| Saída máxima | até o restante da janela de 100.000 tokens; max_tokens opcional (sem limite separado) |
| Chamada de funções | sim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool |
| Modo JSON | response_format: {"type": "json_object"} |
| Parâmetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | sim — server-sent events; o último bloco traz o uso de tokens |
| Limite de taxa | 300 requisições por minuto por chave |
| Concorrência | 8 requisições ao mesmo tempo por chave |
| Tamanho | até 8 MB por requisição |
| Cabeçalhos | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Bônus | +5% a partir de $50, +10% a partir de $100 |
| Preço | $0,25 por 1M tokens de entrada · $1,00 por 1M de saída |
| Cobrança | crédito pré-pago pelo uso real; erros e recusas são grátis |
| Recarga | USDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500 |
| Validade | crédito pago não expira, sem assinatura |
| Teste grátis | $0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga |
| Chaves | uma chave ativa por conta; uma nova substitui a anterior |
| Conteúdo | conteúdo adulto permitido; conteúdo sexual com menores é recusado |
| Login | Google ou e-mail e senha |
Erros e o que fazer
Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais |
401 | missing_key · invalid_key · key_revoked | chave ausente, errada ou substituída |
402 | no_credit | sem crédito — recarregue e continue na hora |
403 | content_blocked | conteúdo sexual com menores — recusado, sem cobrança |
404 | not_found | endpoint desconhecido |
413 | request_too_large | corpo acima de 8 MB |
429 | rate_limited · concurrency | acima de 300/min ou 8 em paralelo — aguarde e tente de novo |
503 | upstream_busy | modelo ocupado — tente em alguns segundos |
Perguntas e respostas
O que acontece se eu exceder meu crédito pré-pago?
Suas requisições receberão erro 402 até você recarregar sua conta. Você pode adicionar crédito via cripto (USDT ou USDC) a partir de $10. O crédito pré-pago existente nunca expira.
O modelo sem censura é fine-tuned ou base?
É um modelo de pesos abertos executado em nossos próprios servidores GPU, especificamente ajustado para responder sem recusas de conteúdo para uso adulto lícito. Não é uma cópia direta do GPT ou Claude.
Posso usar o mesmo código SDK que uso com OpenAI?
Sim. Altere o <code>base_url</code> para <code>https://api.llamaapis.com/v1</code> e atualize a chave de API. Os formatos de requisição e resposta são compatíveis.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.