ES ▾
Obtener clave de API

InicioDocumentación

API de Llama: primera petición en cinco minutos

Obtén tu primera respuesta de un LLM sin censura en menos de cinco minutos. Esta guía rápida muestra cómo reemplazar la configuración de tu cliente OpenAI existente con nuestra URL base y clave de API.

https://api.llamaapis.com/v1uncensored

llamaapis.com

Instalación

Comienza instalando el cliente oficial de OpenAI para Python. Se encarga de las peticiones HTTP y el análisis JSON por ti.

  • pip install openai

También puedes usar el SDK de JavaScript para Node.js. Ambas bibliotecas son totalmente compatibles con nuestra API porque seguimos exactamente la especificación de chat-completions de OpenAI.

Configuración de autenticación

Nuestra API utiliza autenticación estándar con clave de API. Después de registrarte en https://llamaapis.com, recibes una clave inmediatamente. No se requiere tarjeta de crédito para el nivel de prueba.

Almacena esta clave en una variable de entorno o pásala directamente a tu cliente. La clave autentica todas las peticiones a los endpoints /v1. Si pierdes tu clave, puedes regenerarla desde tu panel, lo que invalida la antigua inmediatamente.

Petición básica de finalización de chat

Realiza una petición al endpoint de finalización de chat. Debes establecer la URL base en nuestro servidor y proporcionar tu clave de API.

El ID del modelo es uncensored. Este modelo no aplica filtros de contenido estándar para uso adulto lícito.

Así es como haces una petición simple usando curl:

curl https://api.llamaapis.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

La respuesta devuelve una cadena de texto generada. Si necesitas llamadas a funciones, la estructura es idéntica al formato de OpenAI.

Respuestas en streaming (SSE)

Para salida en tiempo real, activa el streaming estableciendo stream: true. El servidor envía Server-Sent Events (SSE) que contienen deltas parciales.

Esto es útil para interfaces de chat donde deseas mostrar el texto a medida que se genera. La ventana de contexto admite hasta 100.000 tokens, por lo que el streaming funciona eficientemente incluso para conversaciones largas.

Ejemplo de implementación en streaming:

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Recuerda manejar el evento stop para cerrar la conexión de forma limpia.

Soporte para llamadas a herramientas/funciones

Nuestra API admite llamadas a funciones estructuradas. Define tus funciones en el parámetro tools y establece que el modelo responda con llamadas a funciones.

La biblioteca del cliente analizará automáticamente los argumentos JSON. Esto funciona exactamente como se documenta en la especificación de OpenAI.

Ejemplo usando el SDK de Python:

from openai import OpenAI

client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

El modelo devolverá el nombre de la función y los argumentos. Ejecutas la función y envías el resultado de nuevo en el siguiente mensaje.

Límites, errores y contexto

Ten en cuenta los siguientes límites:

  • Límite de peticiones: 300 peticiones por minuto por clave de API.
  • Cuerpo máximo de la petición: 8 MB.
  • Ventana de contexto: 100.000 tokens en total (entrada + salida).

Errores comunes:

  • 401 No autorizado: Clave de API inválida o faltante.
  • 402 Pago requerido: Crédito prepago insuficiente.
  • 429 Demasiadas peticiones: Excediste el límite de 300 rpm.

No ofrecemos embeddings, generación de imágenes ni procesamiento de audio. Esta es una API de LLM solo de texto.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Especificaciones técnicas

Todos los límites y funciones reales de la API en un solo lugar: revísalos antes de recargar.

ElementoValor
Formatocompatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave
AutenticaciónAuthorization: Bearer YOUR_KEY
EndpointsPOST /v1/chat/completions · GET /v1/models
Base URLhttps://api.llamaapis.com/v1
ID del modelouncensored
Ventana de contexto100.000 tokens (entrada + salida)
Salida máximahasta el resto de la ventana de 100.000 tokens; max_tokens opcional (sin límite aparte)
Llamadas a funcionessí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool
Modo JSONresponse_format: {"type": "json_object"}
Parámetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingsí: server-sent events; el último fragmento incluye el uso de tokens
Límite de peticiones300 por minuto por clave
Concurrencia8 peticiones a la vez por clave
Tamaño de peticiónhasta 8 MB
CabecerasX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Bono+5 % desde $50, +10 % desde $100
Precio$0,25 por 1M tokens de entrada · $1,00 por 1M de salida
Facturacióncrédito prepago por uso real; errores y rechazos no se cobran
RecargaUSDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500
Caducidadel crédito pagado no caduca, sin suscripción
Prueba gratis$0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga
Clavesuna clave activa por cuenta; una nueva reemplaza a la anterior
Contenidocontenido adulto permitido; se rechaza el contenido sexual con menores
AccesoGoogle o correo y contraseña

Errores y qué hacer

Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.

CódigoTipoSignificado
400bad_requestJSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo
401missing_key · invalid_key · key_revokedfalta la clave, es incorrecta o fue reemplazada
402no_creditsin crédito: recarga y sigue al instante
403content_blockedcontenido sexual con menores: rechazado, no se cobra
404not_foundendpoint desconocido
413request_too_largecuerpo mayor de 8 MB
429rate_limited · concurrencymás de 300/min o 8 en paralelo: espera y reintenta
503upstream_busymodelo ocupado: reintenta en unos segundos

Preguntas y respuestas

llamaapis.com
¿Qué ocurre si excedo mi crédito prepago?

Tus peticiones recibirán un error 402 hasta que recargues tu cuenta. Puedes añadir crédito mediante criptomonedas (USDT o USDC) a partir de $10. El crédito prepago existente no caduca.

¿El modelo sin censura está ajustado o es base?

Es un modelo de pesos abiertos ejecutado en nuestros propios servidores GPU, específicamente ajustado para responder sin rechazos de contenido para uso adulto lícito. No es una copia directa de GPT o Claude.

¿Puedo usar el mismo código SDK que uso con OpenAI?

Sí. Cambia el <code>base_url</code> a <code>https://api.llamaapis.com/v1</code> y actualiza la clave de API. Los formatos de petición y respuesta son compatibles.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave, cambia la URL base. Esa es toda la configuración.

Obtener clave de API