Inicio/Documentación
API de Llama: primera petición en cinco minutos
Obtén tu primera respuesta de un LLM sin censura en menos de cinco minutos. Esta guía rápida muestra cómo reemplazar la configuración de tu cliente OpenAI existente con nuestra URL base y clave de API.
https://api.llamaapis.com/v1uncensored
Instalación
Comienza instalando el cliente oficial de OpenAI para Python. Se encarga de las peticiones HTTP y el análisis JSON por ti.
- pip install openai
También puedes usar el SDK de JavaScript para Node.js. Ambas bibliotecas son totalmente compatibles con nuestra API porque seguimos exactamente la especificación de chat-completions de OpenAI.
Configuración de autenticación
Nuestra API utiliza autenticación estándar con clave de API. Después de registrarte en https://llamaapis.com, recibes una clave inmediatamente. No se requiere tarjeta de crédito para el nivel de prueba.
Almacena esta clave en una variable de entorno o pásala directamente a tu cliente. La clave autentica todas las peticiones a los endpoints /v1. Si pierdes tu clave, puedes regenerarla desde tu panel, lo que invalida la antigua inmediatamente.
Petición básica de finalización de chat
Realiza una petición al endpoint de finalización de chat. Debes establecer la URL base en nuestro servidor y proporcionar tu clave de API.
El ID del modelo es uncensored. Este modelo no aplica filtros de contenido estándar para uso adulto lícito.
Así es como haces una petición simple usando curl:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'La respuesta devuelve una cadena de texto generada. Si necesitas llamadas a funciones, la estructura es idéntica al formato de OpenAI.
Respuestas en streaming (SSE)
Para salida en tiempo real, activa el streaming estableciendo stream: true. El servidor envía Server-Sent Events (SSE) que contienen deltas parciales.
Esto es útil para interfaces de chat donde deseas mostrar el texto a medida que se genera. La ventana de contexto admite hasta 100.000 tokens, por lo que el streaming funciona eficientemente incluso para conversaciones largas.
Ejemplo de implementación en streaming:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Recuerda manejar el evento stop para cerrar la conexión de forma limpia.
Soporte para llamadas a herramientas/funciones
Nuestra API admite llamadas a funciones estructuradas. Define tus funciones en el parámetro tools y establece que el modelo responda con llamadas a funciones.
La biblioteca del cliente analizará automáticamente los argumentos JSON. Esto funciona exactamente como se documenta en la especificación de OpenAI.
Ejemplo usando el SDK de Python:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)El modelo devolverá el nombre de la función y los argumentos. Ejecutas la función y envías el resultado de nuevo en el siguiente mensaje.
Límites, errores y contexto
Ten en cuenta los siguientes límites:
- Límite de peticiones: 300 peticiones por minuto por clave de API.
- Cuerpo máximo de la petición: 8 MB.
- Ventana de contexto: 100.000 tokens en total (entrada + salida).
Errores comunes:
- 401 No autorizado: Clave de API inválida o faltante.
- 402 Pago requerido: Crédito prepago insuficiente.
- 429 Demasiadas peticiones: Excediste el límite de 300 rpm.
No ofrecemos embeddings, generación de imágenes ni procesamiento de audio. Esta es una API de LLM solo de texto.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Especificaciones técnicas
Todos los límites y funciones reales de la API en un solo lugar: revísalos antes de recargar.
| Elemento | Valor |
|---|---|
| Formato | compatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave |
| Autenticación | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| ID del modelo | uncensored |
| Ventana de contexto | 100.000 tokens (entrada + salida) |
| Salida máxima | hasta el resto de la ventana de 100.000 tokens; max_tokens opcional (sin límite aparte) |
| Llamadas a funciones | sí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool |
| Modo JSON | response_format: {"type": "json_object"} |
| Parámetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | sí: server-sent events; el último fragmento incluye el uso de tokens |
| Límite de peticiones | 300 por minuto por clave |
| Concurrencia | 8 peticiones a la vez por clave |
| Tamaño de petición | hasta 8 MB |
| Cabeceras | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Bono | +5 % desde $50, +10 % desde $100 |
| Precio | $0,25 por 1M tokens de entrada · $1,00 por 1M de salida |
| Facturación | crédito prepago por uso real; errores y rechazos no se cobran |
| Recarga | USDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500 |
| Caducidad | el crédito pagado no caduca, sin suscripción |
| Prueba gratis | $0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga |
| Claves | una clave activa por cuenta; una nueva reemplaza a la anterior |
| Contenido | contenido adulto permitido; se rechaza el contenido sexual con menores |
| Acceso | Google o correo y contraseña |
Errores y qué hacer
Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo |
401 | missing_key · invalid_key · key_revoked | falta la clave, es incorrecta o fue reemplazada |
402 | no_credit | sin crédito: recarga y sigue al instante |
403 | content_blocked | contenido sexual con menores: rechazado, no se cobra |
404 | not_found | endpoint desconocido |
413 | request_too_large | cuerpo mayor de 8 MB |
429 | rate_limited · concurrency | más de 300/min o 8 en paralelo: espera y reintenta |
503 | upstream_busy | modelo ocupado: reintenta en unos segundos |
Preguntas y respuestas
¿Qué ocurre si excedo mi crédito prepago?
Tus peticiones recibirán un error 402 hasta que recargues tu cuenta. Puedes añadir crédito mediante criptomonedas (USDT o USDC) a partir de $10. El crédito prepago existente no caduca.
¿El modelo sin censura está ajustado o es base?
Es un modelo de pesos abiertos ejecutado en nuestros propios servidores GPU, específicamente ajustado para responder sin rechazos de contenido para uso adulto lícito. No es una copia directa de GPT o Claude.
¿Puedo usar el mismo código SDK que uso con OpenAI?
Sí. Cambia el <code>base_url</code> a <code>https://api.llamaapis.com/v1</code> y actualiza la clave de API. Los formatos de petición y respuesta son compatibles.
Tu clave está a un formulario de distancia
Crea una cuenta, copia la clave, cambia la URL base. Esa es toda la configuración.