IT ▾
Ottieni la chiave API

HomeDocs

API Llama: prima richiesta in cinque minuti

Ottieni la tua prima risposta da un LLM senza censura in meno di cinque minuti. Questa guida rapida mostra come sostituire la configurazione del client OpenAI esistente con il nostro base URL e la chiave API.

https://api.llamaapis.com/v1uncensored

llamaapis.com

Installazione

Inizia installando il client Python ufficiale di OpenAI. Gestisce per te le richieste HTTP e l'analisi JSON.

  • pip install openai

Puoi anche usare l'SDK JavaScript per Node.js. Entrambe le librerie sono pienamente compatibili con la nostra API perché seguiamo esattamente la specifica di chat-completions di OpenAI.

Configurazione autenticazione

La nostra API utilizza l'autenticazione standard con chiave API. Dopo esserti registrato su https://llamaapis.com, ricevi una chiave immediatamente. Non è richiesta la carta di credito per il livello di prova.

Memorizza questa chiave in una variabile d'ambiente o passala direttamente al tuo client. La chiave autentica tutte le richieste agli endpoint /v1. Se perdi la chiave, puoi rigenerarla dal tuo dashboard, il che invalida immediatamente quella vecchia.

Richiesta di completamento chat di base

Effettua una richiesta all'endpoint di completamento chat. Devi impostare il base URL sul nostro server e fornire la tua chiave API.

L'ID del modello è uncensored. Questo modello non applica i filtri standard sui contenuti per uso adulto lecito.

Ecco come effettuare una semplice richiesta con curl:

curl https://api.llamaapis.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

La risposta restituisce una stringa di testo generata. Se hai bisogno della chiamata di funzioni, la struttura è identica a quella di OpenAI.

Risposte in streaming (SSE)

Per l'output in tempo reale, abilita lo streaming impostando stream: true. Il server invia Server-Sent Events (SSE) contenenti delta parziali.

Questo è utile per le interfacce chat dove vuoi mostrare il testo man mano che viene generato. La finestra di contesto supporta fino a 100.000 token, quindi lo streaming funziona in modo efficiente anche per conversazioni lunghe.

Esempio di implementazione streaming:

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Ricorda di gestire l'evento stop per chiudere la connessione in modo pulito.

Supporto chiamata di funzioni

La nostra API supporta la chiamata strutturata di strumenti. Definisci le tue funzioni nel parametro tools e imposta il modello per rispondere con chiamate di funzioni.

La libreria client analizzerà automaticamente gli argomenti JSON. Questo funziona esattamente come documentato nella specifica OpenAI.

Esempio usando l'SDK Python:

from openai import OpenAI

client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Il modello restituirà il nome della funzione e gli argomenti. Esecuti la funzione e invii il risultato nel messaggio successivo.

Limiti, errori e contesto

Tieni presente i seguenti limiti:

  • Limite di richieste: 300 richieste al minuto per chiave API.
  • Dimensione massima del corpo della richiesta: 8 MB.
  • Finestra di contesto: 100.000 token totali (input + output).

Errori comuni:

  • 401 Non autorizzato: Chiave API non valida o mancante.
  • 402 Pagamento richiesto: Credito prepagato insufficiente.
  • 429 Troppe richieste: Hai superato il limite di 300 rpm.

Non offriamo embeddings, generazione di immagini o elaborazione audio. Questa è un'API LLM solo testo.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Specifiche tecniche

Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.

VoceValore
Formatocompatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave
AutenticazioneAuthorization: Bearer YOUR_KEY
EndpointPOST /v1/chat/completions · GET /v1/models
Base URLhttps://api.llamaapis.com/v1
ID modellouncensored
Finestra di contesto100.000 token (input + output)
Output massimofino al resto della finestra di 100.000 token; max_tokens opzionale (nessun limite separato)
Function callingsì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool
Modalità JSONresponse_format: {"type": "json_object"}
Parametritemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingsì — server-sent events; l'ultimo blocco riporta l'uso dei token
Limite di frequenza300 richieste al minuto per chiave
Concorrenza8 richieste contemporanee per chiave
Dimensionefino a 8 MB per richiesta
HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Bonus+5% da $50, +10% da $100
Prezzo$0,25 per 1M token in input · $1,00 per 1M in output
Fatturazionecredito prepagato in base all'uso reale; errori e rifiuti gratuiti
RicaricaUSDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500
Scadenzail credito pagato non scade, nessun abbonamento
Prova gratuita$0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica
Chiaviuna chiave attiva per account; una nuova sostituisce la precedente
Contenuticontenuti per adulti consentiti; rifiutati i contenuti sessuali con minori
AccessoGoogle oppure e-mail e password

Codici di errore

Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.

CodiceTipoSignificato
400bad_requestJSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo
401missing_key · invalid_key · key_revokedchiave mancante, errata o sostituita
402no_creditcredito esaurito — ricarica e riparti subito
403content_blockedcontenuti sessuali con minori — rifiutato, non addebitato
404not_foundendpoint sconosciuto
413request_too_largecorpo oltre 8 MB
429rate_limited · concurrencyoltre 300/min o 8 in parallelo — attendi e riprova
503upstream_busymodello occupato — riprova tra pochi secondi

Domande e risposte

llamaapis.com
Cosa succede se supero il credito prepagato?

Le tue richieste restituiranno un errore 402 finché non ricarichi l'account. Puoi aggiungere credito via crypto (USDT o USDC) a partire da $10. Il credito prepagato esistente non scade mai.

Il modello senza censura è fine-tuned o base?

È un modello a pesi aperti eseguito sui nostri server GPU, specificamente ottimizzato per rispondere senza rifiuti sui contenuti per uso adulto lecito. Non è una copia diretta di GPT o Claude.

Posso usare lo stesso codice SDK che uso con OpenAI?

Sì. Modifica il <code>base_url</code> in <code>https://api.llamaapis.com/v1</code> e aggiorna la chiave API. I formati di richiesta e risposta sono compatibili.

La tua chiave è a un modulo di distanza

Crea un account, copia la chiave, modifica il base URL. È tutta la configurazione.

Ottieni la chiave API