Startseite/Dokumentation
Llama-API: Erste Anfrage in fünf Minuten
Erhalte deine erste Antwort eines unzensierten LLM in unter fünf Minuten. Dieses Quickstart zeigt, wie du deine bestehende OpenAI-Clientkonfiguration mit unserer Basis-URL und deinem API-Schlüssel ersetzt.
https://api.llamaapis.com/v1uncensored
Installation
Beginne mit der Installation des offiziellen OpenAI Python-Clients. Er übernimmt die HTTP-Anfragen und die JSON-Parsing für dich.
- pip install openai
Du kannst auch das JavaScript SDK für Node.js verwenden. Beide Bibliotheken sind vollständig mit unserer API kompatibel, da wir die OpenAI-Chat-Vervollständigungs-Spezifikation genau befolgen.
Authentifizierung einrichten
Unsere API verwendet die Standard-API-Schlüssel-Authentifizierung. Nach der Anmeldung unter https://llamaapis.com erhältst du sofort einen Schlüssel. Für die Teststufe ist keine Kreditkarte erforderlich.
Speichere diesen Schlüssel in einer Umgebungsvariable oder übergebe ihn direkt an deinen Client. Der Schlüssel authentifiziert alle Anfragen an die /v1-Endpunkte. Wenn du deinen Schlüssel verlierst, kannst du ihn über dein Dashboard neu generieren, wodurch der alte sofort ungültig wird.
Einfache Chat-Vervollständigungsanfrage
Stelle eine Anfrage an den Chat-Vervollständigungs-Endpunkt. Du musst die Basis-URL auf unseren Server setzen und deinen API-Schlüssel angeben.
Die Modell-ID ist uncensored. Dieses Modell wendet keine Standard-Inhaltsfilter für die rechtmäßige Nutzung durch Erwachsene an.
So stellst du eine einfache Anfrage mit curl:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Die Antwort gibt einen generierten Textstring zurück. Wenn du Function Calling benötigst, ist die Struktur identisch mit dem OpenAI-Format.
Streaming-Antworten (SSE)
Aktiviere für Echtzeit-Ausgaben das Streaming, indem du stream: true setzt. Der Server sendet Server-Sent Events (SSE), die partielle Delta-Werte enthalten.
Dies ist nützlich für Chat-Schnittstellen, in denen du Text anzeigen möchtest, während er generiert wird. Das Kontextfenster unterstützt bis zu 100.000 Token, sodass das Streaming auch bei langen Gesprächen effizient funktioniert.
Beispiel für eine Streaming-Implementierung:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Denke daran, das stop-Ereignis zu behandeln, um die Verbindung sauber zu schließen.
Tool-/Function-Calling-Unterstützung
Unsere API unterstützt strukturiertes Tool-Calling. Definiere deine Funktionen im tools-Parameter und stelle das Modell so ein, dass es mit Function Calls antwortet.
Die Client-Bibliothek parst die JSON-Argumente automatisch. Dies funktioniert genau wie in der OpenAI-Spezifikation dokumentiert.
Beispiel mit dem Python SDK:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Das Modell gibt den Funktionsnamen und die Argumente zurück. Du führst die Funktion aus und sendst das Ergebnis in der nächsten Nachricht zurück.
Grenzen, Fehler und Kontext
Beachte die folgenden Grenzen:
- Ratenlimit: 300 Anfragen pro Minute pro API-Schlüssel.
- Maximaler Anfragekörper: 8 MB.
- Kontextfenster: 100.000 Token insgesamt (Input + Output).
Häufige Fehler:
- 401 Unauthorized: Ungültiger oder fehlender API-Schlüssel.
- 402 Payment Required: Unzureichendes Prepaid-Guthaben.
- 429 Too Many Requests: Du hast das 300-rpm-Limit überschritten.
Wir bieten keine Embeddings, Bildgenerierung oder Audioverarbeitung an. Dies ist eine nur-Text-LLM-API.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Technische Daten
Alle echten Grenzen und Funktionen der API auf einen Blick – prüfen Sie sie, bevor Sie Guthaben kaufen.
| Merkmal | Wert |
|---|---|
| API-Format | OpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern |
| Authentifizierung | Authorization: Bearer YOUR_KEY |
| Endpunkte | POST /v1/chat/completions · GET /v1/models |
| Base-URL | https://api.llamaapis.com/v1 |
| Modell-ID | uncensored |
| Kontextfenster | 100.000 Tokens (Eingabe + Ausgabe) |
| Max. Ausgabe | bis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit) |
| Function Calling | ja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool |
| JSON-Modus | response_format: {"type": "json_object"} |
| Parameter | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | ja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung |
| Ratenlimit | 300 Anfragen pro Minute und Schlüssel |
| Parallelität | 8 gleichzeitige Anfragen pro Schlüssel |
| Anfragegröße | bis 8 MB |
| Antwort-Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Bonus | +5 % ab $50, +10 % ab $100 |
| Preis | $0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens |
| Abrechnung | Prepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos |
| Aufladen | USDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500 |
| Gültigkeit | bezahltes Guthaben verfällt nie, kein Abo |
| Testguthaben | $0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung |
| Schlüssel | ein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten |
| Inhalte | Inhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt |
| Anmeldung | Google oder E-Mail und Passwort |
Fehler und Lösungen
Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.
| Code | Typ | Bedeutung |
|---|---|---|
400 | bad_request | ungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang |
401 | missing_key · invalid_key · key_revoked | Schlüssel fehlt, ist falsch oder wurde ersetzt |
402 | no_credit | kein Guthaben – aufladen, dann geht es sofort weiter |
403 | content_blocked | sexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet |
404 | not_found | unbekannter Endpunkt |
413 | request_too_large | Anfrage größer als 8 MB |
429 | rate_limited · concurrency | über 300/Min. oder 8 parallel – kurz warten |
503 | upstream_busy | Modell ausgelastet – in Sekunden erneut versuchen |
Fragen und Antworten
Was passiert, wenn ich mein Prepaid-Guthaben überschreite?
Deine Anfragen erhalten einen 402-Fehler, bis du dein Konto auflädst. Du kannst Guthaben über Krypto (USDT oder USDC) ab $10 hinzufügen. Bestehendes Prepaid-Guthaben verfällt nie.
Ist das unzensierte Modell feinabgestimmt oder ein Basismodell?
Es ist ein Open-Weight-Modell, das auf unseren eigenen GPU-Servern läuft, speziell abgestimmt, um ohne Inhaltsablehnung für legale Erwachsenenverwendung zu antworten. Es ist keine direkte Kopie von GPT oder Claude.
Kann ich denselben SDK-Code verwenden, den ich mit OpenAI nutze?
Ja. Ändere die <code>base_url</code> in <code>https://api.llamaapis.com/v1</code> und aktualisiere den API-Schlüssel. Die Anfrage- und Antwortformate sind kompatibel.
Dein Schlüssel ist nur ein Formular entfernt
Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.