NL ▾
API-sleutel aanvragen

HomeDocs

Llama API: eerste verzoek in vijf minuten

Krijg je eerste respons van een ongecensureerde LLM in minder dan vijf minuten. Deze quickstart laat zien hoe je je bestaande OpenAI-clientconfiguratie vervangt door onze basis-URL en API-sleutel.

https://api.llamaapis.com/v1uncensored

llamaapis.com

Installatie

Installeer eerst de officiële OpenAI Python-client. Deze verwerkt de HTTP-verzoeken en JSON-parsering voor je.

  • pip install openai

Je kunt ook de JavaScript SDK voor Node.js gebruiken. Beide bibliotheken zijn volledig compatibel met onze API omdat we de OpenAI chat-completions-specificatie exact volgen.

Authenticatie-instellingen

Onze API gebruikt standaard API-sleutelauthenticatie. Na het aanmaken van een account op https://llamaapis.com ontvang je direct een sleutel. Er is geen creditcard nodig voor de trial tier.

Sla deze sleutel op in een omgevingsvariabele of geef deze direct door aan je client. De sleutel verifieert alle verzoeken naar de /v1 endpoints. Als je je sleutel kwijtraakt, kun je deze opnieuw genereren via je dashboard, waardoor de oude sleutel direct ongeldig wordt.

Eenvoudig chatverzoek

Maak een verzoek naar het chat-completions endpoint. Je moet de basis-URL instellen op onze server en je API-sleutel verstrekken.

De model-ID is uncensored. Dit model past geen standaard inhoudsfilters toe voor wettelijk volwassen gebruik.

Zo maak je een eenvoudig verzoek met curl:

curl https://api.llamaapis.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

De respons retourneert een gegenereerde tekstreeks. Als je function calling nodig hebt, is de structuur identiek aan het formaat van OpenAI.

Streaming-antwoorden (SSE)

Schakel streaming in voor realtime output door stream: true in te stellen. De server stuurt Server-Sent Events (SSE) met gedeeltelijke deltas.

Dit is handig voor chatinterfaces waar je tekst wilt tonen terwijl deze wordt gegenereerd. Het contextvenster ondersteunt tot 100.000 tokens, dus streaming werkt efficiënt, zelfs voor lange gesprekken.

Voorbeeld van streaming-implementatie:

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Verwerk het stop-gebeurtenis om de verbinding netjes te sluiten.

Ondersteuning voor gereedschaps-/functaanroeping

Onze API ondersteunt gestructureerde gereedschapsaanroepen. Definieer je functies in de parameter tools en stel het model in om te reageren met functaanroepen.

De clientbibliotheek parseert de JSON-argumenten automatisch. Dit werkt exact zoals gedocumenteerd in de OpenAI-specificatie.

Voorbeeld met de Python SDK:

from openai import OpenAI

client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Het model retourneert de functienaam en argumenten. Je voert de functie uit en stuurt het resultaat terug in het volgende bericht.

Limieten, fouten en context

Houd rekening met de volgende limieten:

  • Rate limit: 300 verzoeken per minuut per API-sleutel.
  • Maximale request body: 8 MB.
  • Contextvenster: 100.000 tokens in totaal (input + output).

Veelvoorkomende fouten:

  • 401 Unauthorized: Ongeldige of ontbrekende API-sleutel.
  • 402 Payment Required: Onvoldoende prepaid tegoed.
  • 429 Too Many Requests: Je hebt de limiet van 300 rpm overschreden.

We bieden geen embeddings, image generation of audio processing. Dit is een text-only LLM API.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Technische specificaties

Alle echte limieten en functies van de API op één plek — controleer ze voordat je opwaardeert.

OnderdeelWaarde
API-formaatOpenAI-compatibel: elke OpenAI-SDK werkt — vervang alleen base URL en sleutel
AuthenticatieAuthorization: Bearer YOUR_KEY
EndpointsPOST /v1/chat/completions · GET /v1/models
Base URLhttps://api.llamaapis.com/v1
Model-IDuncensored
Contextvenster100.000 tokens (invoer + uitvoer)
Max. uitvoertot de rest van het venster van 100.000 tokens; max_tokens optioneel (geen aparte limiet)
Function callingja — tools, tool_choice; antwoorden bevatten tool_calls, ook bij streaming; resultaten als role: tool
JSON-modusresponse_format: {"type": "json_object"}
Parameterstemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingja — server-sent events; het laatste deel bevat het tokenverbruik
Rate limit300 verzoeken per minuut per sleutel
Gelijktijdige verzoekentot 8 tegelijk per sleutel
Verzoekgroottetot 8 MB
ResponsheadersX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Bonus+5% vanaf $50, +10% vanaf $100
Prijs$0,25 per 1 mln invoertokens · $1,00 per 1 mln uitvoertokens
Afrekeningprepaid tegoed op basis van echt verbruik; fouten en weigeringen zijn gratis
OpwaarderenUSDT (TRC20) of USDC (Base), elk heel bedrag van $10 tot $500
Geldigheidbetaald tegoed verloopt niet, geen abonnement
Gratis proeftegoed$0,50 voor 7 dagen, zonder kaart · Proefsleutel: 2 parallelle verzoeken, 60 per minuut; volledige limieten (8 en 300) na eerste opwaardering
Sleutelséén actieve sleutel per account; een nieuwe vervangt de oude
Inhoudinhoud voor volwassenen toegestaan; seksuele inhoud met minderjarigen wordt geweigerd
InloggenGoogle of e-mail en wachtwoord

Foutcodes

Fouten komen als JSON met een vaste type; mislukte of geweigerde verzoeken kosten niets.

CodeTypeBetekenis
400bad_requestongeldige JSON, lege berichten, verkeerde parameter of context te lang
401missing_key · invalid_key · key_revokedsleutel ontbreekt, is onjuist of is vervangen
402no_creditgeen tegoed — waardeer op en ga direct verder
403content_blockedseksuele inhoud met minderjarigen — geweigerd, niet gerekend
404not_foundonbekend endpoint
413request_too_largebody groter dan 8 MB
429rate_limited · concurrencymeer dan 300/min of 8 tegelijk — wacht en probeer opnieuw
503upstream_busymodel bezet — probeer het over enkele seconden opnieuw

Vragen en antwoorden

llamaapis.com
Wat gebeurt er als ik mijn prepaid tegoed overschrijd?

Je verzoeken krijgen een 402-foutmelding totdat je je account opwaardeert. Je kunt tegoed toevoegen via crypto (USDT of USDC) vanaf $10. Bestaand prepaid tegoed verloopt nooit.

Is het ongecensureerde model gefinetuned of een basismodel?

Het is een open-weight model dat op onze eigen GPU-servers draait, specifiek afgestemd om zonder inhoudsrefusals te antwoorden voor wettelijk volwassen gebruik. Het is geen directe kopie van GPT of Claude.

Kan ik dezelfde SDK-code gebruiken die ik met OpenAI gebruik?

Ja. Wijzig de <code>base_url</code> naar <code>https://api.llamaapis.com/v1</code> en werk je API-sleutel bij. De verzoek- en responsformaten zijn compatibel.

Je sleutel is nog maar één formulier verwijderd

Maak een account aan, kopieer de sleutel, wijzig de basis-URL. Dat is de hele setup.

API-sleutel aanvragen