Home/Docs
Llama API: eerste verzoek in vijf minuten
Krijg je eerste respons van een ongecensureerde LLM in minder dan vijf minuten. Deze quickstart laat zien hoe je je bestaande OpenAI-clientconfiguratie vervangt door onze basis-URL en API-sleutel.
https://api.llamaapis.com/v1uncensored
Installatie
Installeer eerst de officiële OpenAI Python-client. Deze verwerkt de HTTP-verzoeken en JSON-parsering voor je.
- pip install openai
Je kunt ook de JavaScript SDK voor Node.js gebruiken. Beide bibliotheken zijn volledig compatibel met onze API omdat we de OpenAI chat-completions-specificatie exact volgen.
Authenticatie-instellingen
Onze API gebruikt standaard API-sleutelauthenticatie. Na het aanmaken van een account op https://llamaapis.com ontvang je direct een sleutel. Er is geen creditcard nodig voor de trial tier.
Sla deze sleutel op in een omgevingsvariabele of geef deze direct door aan je client. De sleutel verifieert alle verzoeken naar de /v1 endpoints. Als je je sleutel kwijtraakt, kun je deze opnieuw genereren via je dashboard, waardoor de oude sleutel direct ongeldig wordt.
Eenvoudig chatverzoek
Maak een verzoek naar het chat-completions endpoint. Je moet de basis-URL instellen op onze server en je API-sleutel verstrekken.
De model-ID is uncensored. Dit model past geen standaard inhoudsfilters toe voor wettelijk volwassen gebruik.
Zo maak je een eenvoudig verzoek met curl:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'De respons retourneert een gegenereerde tekstreeks. Als je function calling nodig hebt, is de structuur identiek aan het formaat van OpenAI.
Streaming-antwoorden (SSE)
Schakel streaming in voor realtime output door stream: true in te stellen. De server stuurt Server-Sent Events (SSE) met gedeeltelijke deltas.
Dit is handig voor chatinterfaces waar je tekst wilt tonen terwijl deze wordt gegenereerd. Het contextvenster ondersteunt tot 100.000 tokens, dus streaming werkt efficiënt, zelfs voor lange gesprekken.
Voorbeeld van streaming-implementatie:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Verwerk het stop-gebeurtenis om de verbinding netjes te sluiten.
Ondersteuning voor gereedschaps-/functaanroeping
Onze API ondersteunt gestructureerde gereedschapsaanroepen. Definieer je functies in de parameter tools en stel het model in om te reageren met functaanroepen.
De clientbibliotheek parseert de JSON-argumenten automatisch. Dit werkt exact zoals gedocumenteerd in de OpenAI-specificatie.
Voorbeeld met de Python SDK:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Het model retourneert de functienaam en argumenten. Je voert de functie uit en stuurt het resultaat terug in het volgende bericht.
Limieten, fouten en context
Houd rekening met de volgende limieten:
- Rate limit: 300 verzoeken per minuut per API-sleutel.
- Maximale request body: 8 MB.
- Contextvenster: 100.000 tokens in totaal (input + output).
Veelvoorkomende fouten:
- 401 Unauthorized: Ongeldige of ontbrekende API-sleutel.
- 402 Payment Required: Onvoldoende prepaid tegoed.
- 429 Too Many Requests: Je hebt de limiet van 300 rpm overschreden.
We bieden geen embeddings, image generation of audio processing. Dit is een text-only LLM API.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Technische specificaties
Alle echte limieten en functies van de API op één plek — controleer ze voordat je opwaardeert.
| Onderdeel | Waarde |
|---|---|
| API-formaat | OpenAI-compatibel: elke OpenAI-SDK werkt — vervang alleen base URL en sleutel |
| Authenticatie | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| Model-ID | uncensored |
| Contextvenster | 100.000 tokens (invoer + uitvoer) |
| Max. uitvoer | tot de rest van het venster van 100.000 tokens; max_tokens optioneel (geen aparte limiet) |
| Function calling | ja — tools, tool_choice; antwoorden bevatten tool_calls, ook bij streaming; resultaten als role: tool |
| JSON-modus | response_format: {"type": "json_object"} |
| Parameters | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | ja — server-sent events; het laatste deel bevat het tokenverbruik |
| Rate limit | 300 verzoeken per minuut per sleutel |
| Gelijktijdige verzoeken | tot 8 tegelijk per sleutel |
| Verzoekgrootte | tot 8 MB |
| Responsheaders | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Bonus | +5% vanaf $50, +10% vanaf $100 |
| Prijs | $0,25 per 1 mln invoertokens · $1,00 per 1 mln uitvoertokens |
| Afrekening | prepaid tegoed op basis van echt verbruik; fouten en weigeringen zijn gratis |
| Opwaarderen | USDT (TRC20) of USDC (Base), elk heel bedrag van $10 tot $500 |
| Geldigheid | betaald tegoed verloopt niet, geen abonnement |
| Gratis proeftegoed | $0,50 voor 7 dagen, zonder kaart · Proefsleutel: 2 parallelle verzoeken, 60 per minuut; volledige limieten (8 en 300) na eerste opwaardering |
| Sleutels | één actieve sleutel per account; een nieuwe vervangt de oude |
| Inhoud | inhoud voor volwassenen toegestaan; seksuele inhoud met minderjarigen wordt geweigerd |
| Inloggen | Google of e-mail en wachtwoord |
Foutcodes
Fouten komen als JSON met een vaste type; mislukte of geweigerde verzoeken kosten niets.
| Code | Type | Betekenis |
|---|---|---|
400 | bad_request | ongeldige JSON, lege berichten, verkeerde parameter of context te lang |
401 | missing_key · invalid_key · key_revoked | sleutel ontbreekt, is onjuist of is vervangen |
402 | no_credit | geen tegoed — waardeer op en ga direct verder |
403 | content_blocked | seksuele inhoud met minderjarigen — geweigerd, niet gerekend |
404 | not_found | onbekend endpoint |
413 | request_too_large | body groter dan 8 MB |
429 | rate_limited · concurrency | meer dan 300/min of 8 tegelijk — wacht en probeer opnieuw |
503 | upstream_busy | model bezet — probeer het over enkele seconden opnieuw |
Vragen en antwoorden
Wat gebeurt er als ik mijn prepaid tegoed overschrijd?
Je verzoeken krijgen een 402-foutmelding totdat je je account opwaardeert. Je kunt tegoed toevoegen via crypto (USDT of USDC) vanaf $10. Bestaand prepaid tegoed verloopt nooit.
Is het ongecensureerde model gefinetuned of een basismodel?
Het is een open-weight model dat op onze eigen GPU-servers draait, specifiek afgestemd om zonder inhoudsrefusals te antwoorden voor wettelijk volwassen gebruik. Het is geen directe kopie van GPT of Claude.
Kan ik dezelfde SDK-code gebruiken die ik met OpenAI gebruik?
Ja. Wijzig de <code>base_url</code> naar <code>https://api.llamaapis.com/v1</code> en werk je API-sleutel bij. De verzoek- en responsformaten zijn compatibel.
Je sleutel is nog maar één formulier verwijderd
Maak een account aan, kopieer de sleutel, wijzig de basis-URL. Dat is de hele setup.