Accueil/Docs
API Llama : première requête en cinq minutes
Obtenez votre première réponse d'un LLM sans censure en moins de cinq minutes. Ce guide rapide montre comment remplacer la configuration de votre client OpenAI existant par notre URL de base et votre clé API.
https://api.llamaapis.com/v1uncensored
Installation
Commencez par installer le client Python officiel OpenAI. Il gère les requêtes HTTP et l'analyse JSON pour vous.
- pip install openai
Vous pouvez également utiliser le SDK JavaScript pour Node.js. Les deux bibliothèques sont entièrement compatibles avec notre API car nous suivons exactement la spécification chat-completions d'OpenAI.
Configuration de l'authentification
Notre API utilise l'authentification standard par clé API. Après vous être inscrit sur https://llamaapis.com, vous recevez une clé immédiatement. Aucune carte bancaire n'est requise pour le niveau d'essai.
Conservez cette clé dans une variable d'environnement ou transmettez-la directement à votre client. La clé authentifie toutes les requêtes vers les endpoints /v1. Si vous perdez votre clé, vous pouvez la régénérer depuis votre tableau de bord, ce qui invalide immédiatement l'ancienne.
Requête de complétion de chat basique
Effectuez une requête vers l'endpoint de complétion de chat. Vous devez définir l'URL de base sur notre serveur et fournir votre clé API.
L'ID du modèle est uncensored. Ce modèle n'applique pas les filtres de contenu standards pour une utilisation adulte légale.
Voici comment effectuer une requête simple avec curl :
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'La réponse retourne une chaîne de texte générée. Si vous avez besoin de l'appel de fonctions, la structure est identique au format d'OpenAI.
Réponses en streaming (SSE)
Pour une sortie en temps réel, activez le streaming en définissant stream: true. Le serveur envoie des Server-Sent Events (SSE) contenant des deltas partiels.
Ceci est utile pour les interfaces de chat où vous souhaitez afficher le texte au fur et à mesure de sa génération. La fenêtre de contexte prend en charge jusqu'à 100 000 tokens, donc le streaming fonctionne efficacement même pour de longues conversations.
Exemple d'implémentation en streaming :
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)N'oubliez pas de gérer l'événement stop pour fermer la connexion proprement.
Prise en charge de l'appel de fonctions
Notre API prend en charge l'appel de fonctions structuré. Définissez vos fonctions dans le paramètre tools et définissez le modèle pour qu'il réponde avec des appels de fonctions.
La bibliothèque client analysera automatiquement les arguments JSON. Cela fonctionne exactement comme documenté dans la spécification OpenAI.
Exemple utilisant le SDK Python :
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Le modèle retournera le nom de la fonction et les arguments. Vous exécutez la fonction et envoyez le résultat dans le message suivant.
Limites, erreurs et contexte
Soyez conscient des limites suivantes :
- Limite de débit : 300 requêtes par minute par clé API.
- Taille maximale du corps de la requête : 8 Mo.
- Fenêtre de contexte : 100 000 tokens au total (entrée + sortie).
Erreurs courantes :
- 401 Non autorisé : Clé API invalide ou manquante.
- 402 Paiement requis : Crédit prépayé insuffisant.
- 429 Trop de requêtes : Vous avez dépassé la limite de 300 rpm.
Nous ne proposons pas d'embeddings, de génération d'images ni de traitement audio. Il s'agit d'une API LLM textuelle uniquement.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Caractéristiques techniques
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| Authentification | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| ID du modèle | uncensored |
| Fenêtre de contexte | 100 000 tokens (entrée + sortie) |
| Sortie max. | jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Mode JSON | response_format: {"type": "json_object"} |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Limite de débit | 300 requêtes par minute et par clé |
| Concurrence | 8 requêtes simultanées par clé |
| Taille | jusqu'à 8 Mo par requête |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
| Connexion | Google ou e-mail et mot de passe |
Erreurs et solutions
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
Que se passe-t-il si vous dépassez votre crédit prépayé ?
Vos requêtes recevront une erreur 402 jusqu'à ce que vous rechargiez votre compte. Vous pouvez ajouter du crédit via crypto (USDT ou USDC) à partir de 10 $. Le crédit prépayé existant n'expire jamais.
Le modèle sans censure est-il un modèle de base ou affiné ?
Il s'agit d'un modèle à poids ouverts exécuté sur nos propres serveurs GPU, spécifiquement ajusté pour répondre sans refus de contenu pour un usage adulte légal. Ce n'est pas une copie directe de GPT ou Claude.
Puis-je utiliser le même code SDK que celui utilisé avec OpenAI ?
Oui. Modifiez <code>base_url</code> vers <code>https://api.llamaapis.com/v1</code> et mettez à jour la clé API. Les formats de requête et de réponse sont compatibles.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.