PT ▾
Obter chave de API

InícioDocumentação

API Llama: primeira requisição em cinco minutos

Obtenha sua primeira resposta de um LLM sem censura em menos de cinco minutos. Este guia rápido mostra como substituir a configuração do cliente OpenAI existente pela nossa URL base e chave de API.

https://api.llamaapis.com/v1uncensored

llamaapis.com

Instalação

Comece instalando o cliente oficial OpenAI para Python. Ele cuida das requisições HTTP e análise JSON para você.

  • pip install openai

Você também pode usar o SDK JavaScript para Node.js. Ambas as bibliotecas são totalmente compatíveis com nossa API porque seguimos a especificação de chat-completions da OpenAI exatamente.

Configuração de Autenticação

Nossa API usa autenticação padrão com chave de API. Após entrar em https://llamaapis.com, você recebe uma chave imediatamente. Nenhum cartão de crédito é necessário para o crédito de teste grátis.

Armazene esta chave em uma variável de ambiente ou passe-a diretamente para seu cliente. A chave autentica todas as requisições aos endpoints /v1. Se você perder sua chave, pode regenerá-la no seu painel, o que invalida a antiga imediatamente.

Requisição Básica de Chat

Faça uma requisição ao endpoint de conclusões de chat. Você deve definir o endpoint base para nosso servidor e fornecer sua chave de API.

O ID do modelo é uncensored. Este modelo não aplica filtros de conteúdo padrão para uso adulto lícito.

Veja como fazer uma requisição simples usando curl:

curl https://api.llamaapis.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

A resposta retorna uma string de texto gerada. Se você precisar de chamada de funções, a estrutura é idêntica ao formato da OpenAI.

Respostas em Streaming (SSE)

Para saída em tempo real, ative o streaming definindo stream: true. O servidor envia Eventos Enviados pelo Servidor (SSE) contendo deltas parciais.

Isso é útil para interfaces de chat onde você deseja mostrar o texto conforme é gerado. A janela de contexto suporta até 100.000 tokens, então o streaming funciona eficientemente mesmo para conversas longas.

Exemplo de implementação em streaming:

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Lembre-se de lidar com o evento stop para fechar a conexão limpidamente.

Suporte a Chamada de Ferramentas/Funções

Nossa API suporta chamada estruturada de ferramentas. Defina suas funções no parâmetro tools e defina o modelo para responder com chamadas de funções.

A biblioteca cliente analisará os argumentos JSON automaticamente. Isso funciona exatamente como documentado na especificação da OpenAI.

Exemplo usando o SDK Python:

from openai import OpenAI

client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

O modelo retornará o nome da função e os argumentos. Você executa a função e envia o resultado de volta na próxima mensagem.

Limites, Erros e Contexto

Esteja ciente dos seguintes limites:

  • Limite de requisições: 300 requisições por minuto por chave de API.
  • Corpo máximo da requisição: 8 MB.
  • Janela de contexto: 100.000 tokens no total (entrada + saída).

Erros comuns:

  • 401 Não Autorizado: Chave de API inválida ou ausente.
  • 402 Pagamento Necessário: Crédito pré-pago insuficiente.
  • 429 Muitas Requisições: Você excedeu o limite de 300 rpm.

Não oferecemos embeddings, geração de imagens ou processamento de áudio. Esta é uma API LLM apenas para texto.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Especificações técnicas

Todos os limites e recursos reais da API em um só lugar — confira antes de recarregar.

ItemValor
Formatocompatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave
AutenticaçãoAuthorization: Bearer YOUR_KEY
EndpointsPOST /v1/chat/completions · GET /v1/models
Base URLhttps://api.llamaapis.com/v1
ID do modelouncensored
Janela de contexto100.000 tokens (entrada + saída)
Saída máximaaté o restante da janela de 100.000 tokens; max_tokens opcional (sem limite separado)
Chamada de funçõessim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool
Modo JSONresponse_format: {"type": "json_object"}
Parâmetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingsim — server-sent events; o último bloco traz o uso de tokens
Limite de taxa300 requisições por minuto por chave
Concorrência8 requisições ao mesmo tempo por chave
Tamanhoaté 8 MB por requisição
CabeçalhosX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Bônus+5% a partir de $50, +10% a partir de $100
Preço$0,25 por 1M tokens de entrada · $1,00 por 1M de saída
Cobrançacrédito pré-pago pelo uso real; erros e recusas são grátis
RecargaUSDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500
Validadecrédito pago não expira, sem assinatura
Teste grátis$0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga
Chavesuma chave ativa por conta; uma nova substitui a anterior
Conteúdoconteúdo adulto permitido; conteúdo sexual com menores é recusado
LoginGoogle ou e-mail e senha

Erros e o que fazer

Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.

CódigoTipoSignificado
400bad_requestJSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais
401missing_key · invalid_key · key_revokedchave ausente, errada ou substituída
402no_creditsem crédito — recarregue e continue na hora
403content_blockedconteúdo sexual com menores — recusado, sem cobrança
404not_foundendpoint desconhecido
413request_too_largecorpo acima de 8 MB
429rate_limited · concurrencyacima de 300/min ou 8 em paralelo — aguarde e tente de novo
503upstream_busymodelo ocupado — tente em alguns segundos

Perguntas e respostas

llamaapis.com
O que acontece se eu exceder meu crédito pré-pago?

Suas requisições receberão erro 402 até você recarregar sua conta. Você pode adicionar crédito via cripto (USDT ou USDC) a partir de $10. O crédito pré-pago existente nunca expira.

O modelo sem censura é fine-tuned ou base?

É um modelo de pesos abertos executado em nossos próprios servidores GPU, especificamente ajustado para responder sem recusas de conteúdo para uso adulto lícito. Não é uma cópia direta do GPT ou Claude.

Posso usar o mesmo código SDK que uso com OpenAI?

Sim. Altere o <code>base_url</code> para <code>https://api.llamaapis.com/v1</code> e atualize a chave de API. Os formatos de requisição e resposta são compatíveis.

Sua chave está a um formulário de distância

Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.

Obter chave de API