Home/Docs
API Llama: prima richiesta in cinque minuti
Ottieni la tua prima risposta da un LLM senza censura in meno di cinque minuti. Questa guida rapida mostra come sostituire la configurazione del client OpenAI esistente con il nostro base URL e la chiave API.
https://api.llamaapis.com/v1uncensored
Installazione
Inizia installando il client Python ufficiale di OpenAI. Gestisce per te le richieste HTTP e l'analisi JSON.
- pip install openai
Puoi anche usare l'SDK JavaScript per Node.js. Entrambe le librerie sono pienamente compatibili con la nostra API perché seguiamo esattamente la specifica di chat-completions di OpenAI.
Configurazione autenticazione
La nostra API utilizza l'autenticazione standard con chiave API. Dopo esserti registrato su https://llamaapis.com, ricevi una chiave immediatamente. Non è richiesta la carta di credito per il livello di prova.
Memorizza questa chiave in una variabile d'ambiente o passala direttamente al tuo client. La chiave autentica tutte le richieste agli endpoint /v1. Se perdi la chiave, puoi rigenerarla dal tuo dashboard, il che invalida immediatamente quella vecchia.
Richiesta di completamento chat di base
Effettua una richiesta all'endpoint di completamento chat. Devi impostare il base URL sul nostro server e fornire la tua chiave API.
L'ID del modello è uncensored. Questo modello non applica i filtri standard sui contenuti per uso adulto lecito.
Ecco come effettuare una semplice richiesta con curl:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'La risposta restituisce una stringa di testo generata. Se hai bisogno della chiamata di funzioni, la struttura è identica a quella di OpenAI.
Risposte in streaming (SSE)
Per l'output in tempo reale, abilita lo streaming impostando stream: true. Il server invia Server-Sent Events (SSE) contenenti delta parziali.
Questo è utile per le interfacce chat dove vuoi mostrare il testo man mano che viene generato. La finestra di contesto supporta fino a 100.000 token, quindi lo streaming funziona in modo efficiente anche per conversazioni lunghe.
Esempio di implementazione streaming:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Ricorda di gestire l'evento stop per chiudere la connessione in modo pulito.
Supporto chiamata di funzioni
La nostra API supporta la chiamata strutturata di strumenti. Definisci le tue funzioni nel parametro tools e imposta il modello per rispondere con chiamate di funzioni.
La libreria client analizzerà automaticamente gli argomenti JSON. Questo funziona esattamente come documentato nella specifica OpenAI.
Esempio usando l'SDK Python:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Il modello restituirà il nome della funzione e gli argomenti. Esecuti la funzione e invii il risultato nel messaggio successivo.
Limiti, errori e contesto
Tieni presente i seguenti limiti:
- Limite di richieste: 300 richieste al minuto per chiave API.
- Dimensione massima del corpo della richiesta: 8 MB.
- Finestra di contesto: 100.000 token totali (input + output).
Errori comuni:
- 401 Non autorizzato: Chiave API non valida o mancante.
- 402 Pagamento richiesto: Credito prepagato insufficiente.
- 429 Troppe richieste: Hai superato il limite di 300 rpm.
Non offriamo embeddings, generazione di immagini o elaborazione audio. Questa è un'API LLM solo testo.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Specifiche tecniche
Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.
| Voce | Valore |
|---|---|
| Formato | compatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave |
| Autenticazione | Authorization: Bearer YOUR_KEY |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| ID modello | uncensored |
| Finestra di contesto | 100.000 token (input + output) |
| Output massimo | fino al resto della finestra di 100.000 token; max_tokens opzionale (nessun limite separato) |
| Function calling | sì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool |
| Modalità JSON | response_format: {"type": "json_object"} |
| Parametri | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | sì — server-sent events; l'ultimo blocco riporta l'uso dei token |
| Limite di frequenza | 300 richieste al minuto per chiave |
| Concorrenza | 8 richieste contemporanee per chiave |
| Dimensione | fino a 8 MB per richiesta |
| Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Bonus | +5% da $50, +10% da $100 |
| Prezzo | $0,25 per 1M token in input · $1,00 per 1M in output |
| Fatturazione | credito prepagato in base all'uso reale; errori e rifiuti gratuiti |
| Ricarica | USDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500 |
| Scadenza | il credito pagato non scade, nessun abbonamento |
| Prova gratuita | $0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica |
| Chiavi | una chiave attiva per account; una nuova sostituisce la precedente |
| Contenuti | contenuti per adulti consentiti; rifiutati i contenuti sessuali con minori |
| Accesso | Google oppure e-mail e password |
Codici di errore
Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.
| Codice | Tipo | Significato |
|---|---|---|
400 | bad_request | JSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo |
401 | missing_key · invalid_key · key_revoked | chiave mancante, errata o sostituita |
402 | no_credit | credito esaurito — ricarica e riparti subito |
403 | content_blocked | contenuti sessuali con minori — rifiutato, non addebitato |
404 | not_found | endpoint sconosciuto |
413 | request_too_large | corpo oltre 8 MB |
429 | rate_limited · concurrency | oltre 300/min o 8 in parallelo — attendi e riprova |
503 | upstream_busy | modello occupato — riprova tra pochi secondi |
Domande e risposte
Cosa succede se supero il credito prepagato?
Le tue richieste restituiranno un errore 402 finché non ricarichi l'account. Puoi aggiungere credito via crypto (USDT o USDC) a partire da $10. Il credito prepagato esistente non scade mai.
Il modello senza censura è fine-tuned o base?
È un modello a pesi aperti eseguito sui nostri server GPU, specificamente ottimizzato per rispondere senza rifiuti sui contenuti per uso adulto lecito. Non è una copia diretta di GPT o Claude.
Posso usare lo stesso codice SDK che uso con OpenAI?
Sì. Modifica il <code>base_url</code> in <code>https://api.llamaapis.com/v1</code> e aggiorna la chiave API. I formati di richiesta e risposta sono compatibili.
La tua chiave è a un modulo di distanza
Crea un account, copia la chiave, modifica il base URL. È tutta la configurazione.