DE ▾
API-Schlüssel erhalten

StartseiteDokumentation

Llama-API: Erste Anfrage in fünf Minuten

Erhalte deine erste Antwort eines unzensierten LLM in unter fünf Minuten. Dieses Quickstart zeigt, wie du deine bestehende OpenAI-Clientkonfiguration mit unserer Basis-URL und deinem API-Schlüssel ersetzt.

https://api.llamaapis.com/v1uncensored

llamaapis.com

Installation

Beginne mit der Installation des offiziellen OpenAI Python-Clients. Er übernimmt die HTTP-Anfragen und die JSON-Parsing für dich.

  • pip install openai

Du kannst auch das JavaScript SDK für Node.js verwenden. Beide Bibliotheken sind vollständig mit unserer API kompatibel, da wir die OpenAI-Chat-Vervollständigungs-Spezifikation genau befolgen.

Authentifizierung einrichten

Unsere API verwendet die Standard-API-Schlüssel-Authentifizierung. Nach der Anmeldung unter https://llamaapis.com erhältst du sofort einen Schlüssel. Für die Teststufe ist keine Kreditkarte erforderlich.

Speichere diesen Schlüssel in einer Umgebungsvariable oder übergebe ihn direkt an deinen Client. Der Schlüssel authentifiziert alle Anfragen an die /v1-Endpunkte. Wenn du deinen Schlüssel verlierst, kannst du ihn über dein Dashboard neu generieren, wodurch der alte sofort ungültig wird.

Einfache Chat-Vervollständigungsanfrage

Stelle eine Anfrage an den Chat-Vervollständigungs-Endpunkt. Du musst die Basis-URL auf unseren Server setzen und deinen API-Schlüssel angeben.

Die Modell-ID ist uncensored. Dieses Modell wendet keine Standard-Inhaltsfilter für die rechtmäßige Nutzung durch Erwachsene an.

So stellst du eine einfache Anfrage mit curl:

curl https://api.llamaapis.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Die Antwort gibt einen generierten Textstring zurück. Wenn du Function Calling benötigst, ist die Struktur identisch mit dem OpenAI-Format.

Streaming-Antworten (SSE)

Aktiviere für Echtzeit-Ausgaben das Streaming, indem du stream: true setzt. Der Server sendet Server-Sent Events (SSE), die partielle Delta-Werte enthalten.

Dies ist nützlich für Chat-Schnittstellen, in denen du Text anzeigen möchtest, während er generiert wird. Das Kontextfenster unterstützt bis zu 100.000 Token, sodass das Streaming auch bei langen Gesprächen effizient funktioniert.

Beispiel für eine Streaming-Implementierung:

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Denke daran, das stop-Ereignis zu behandeln, um die Verbindung sauber zu schließen.

Tool-/Function-Calling-Unterstützung

Unsere API unterstützt strukturiertes Tool-Calling. Definiere deine Funktionen im tools-Parameter und stelle das Modell so ein, dass es mit Function Calls antwortet.

Die Client-Bibliothek parst die JSON-Argumente automatisch. Dies funktioniert genau wie in der OpenAI-Spezifikation dokumentiert.

Beispiel mit dem Python SDK:

from openai import OpenAI

client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Das Modell gibt den Funktionsnamen und die Argumente zurück. Du führst die Funktion aus und sendst das Ergebnis in der nächsten Nachricht zurück.

Grenzen, Fehler und Kontext

Beachte die folgenden Grenzen:

  • Ratenlimit: 300 Anfragen pro Minute pro API-Schlüssel.
  • Maximaler Anfragekörper: 8 MB.
  • Kontextfenster: 100.000 Token insgesamt (Input + Output).

Häufige Fehler:

  • 401 Unauthorized: Ungültiger oder fehlender API-Schlüssel.
  • 402 Payment Required: Unzureichendes Prepaid-Guthaben.
  • 429 Too Many Requests: Du hast das 300-rpm-Limit überschritten.

Wir bieten keine Embeddings, Bildgenerierung oder Audioverarbeitung an. Dies ist eine nur-Text-LLM-API.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Technische Daten

Alle echten Grenzen und Funktionen der API auf einen Blick – prüfen Sie sie, bevor Sie Guthaben kaufen.

MerkmalWert
API-FormatOpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern
AuthentifizierungAuthorization: Bearer YOUR_KEY
EndpunktePOST /v1/chat/completions · GET /v1/models
Base-URLhttps://api.llamaapis.com/v1
Modell-IDuncensored
Kontextfenster100.000 Tokens (Eingabe + Ausgabe)
Max. Ausgabebis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit)
Function Callingja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool
JSON-Modusresponse_format: {"type": "json_object"}
Parametertemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung
Ratenlimit300 Anfragen pro Minute und Schlüssel
Parallelität8 gleichzeitige Anfragen pro Schlüssel
Anfragegrößebis 8 MB
Antwort-HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Bonus+5 % ab $50, +10 % ab $100
Preis$0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens
AbrechnungPrepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos
AufladenUSDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500
Gültigkeitbezahltes Guthaben verfällt nie, kein Abo
Testguthaben$0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung
Schlüsselein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten
InhalteInhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt
AnmeldungGoogle oder E-Mail und Passwort

Fehler und Lösungen

Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.

CodeTypBedeutung
400bad_requestungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang
401missing_key · invalid_key · key_revokedSchlüssel fehlt, ist falsch oder wurde ersetzt
402no_creditkein Guthaben – aufladen, dann geht es sofort weiter
403content_blockedsexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet
404not_foundunbekannter Endpunkt
413request_too_largeAnfrage größer als 8 MB
429rate_limited · concurrencyüber 300/Min. oder 8 parallel – kurz warten
503upstream_busyModell ausgelastet – in Sekunden erneut versuchen

Fragen und Antworten

llamaapis.com
Was passiert, wenn ich mein Prepaid-Guthaben überschreite?

Deine Anfragen erhalten einen 402-Fehler, bis du dein Konto auflädst. Du kannst Guthaben über Krypto (USDT oder USDC) ab $10 hinzufügen. Bestehendes Prepaid-Guthaben verfällt nie.

Ist das unzensierte Modell feinabgestimmt oder ein Basismodell?

Es ist ein Open-Weight-Modell, das auf unseren eigenen GPU-Servern läuft, speziell abgestimmt, um ohne Inhaltsablehnung für legale Erwachsenenverwendung zu antworten. Es ist keine direkte Kopie von GPT oder Claude.

Kann ich denselben SDK-Code verwenden, den ich mit OpenAI nutze?

Ja. Ändere die <code>base_url</code> in <code>https://api.llamaapis.com/v1</code> und aktualisiere den API-Schlüssel. Die Anfrage- und Antwortformate sind kompatibel.

Dein Schlüssel ist nur ein Formular entfernt

Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.

API-Schlüssel erhalten