PL ▾
Pobierz klucz API

Strona głównaDokumentacja

API Llamy: pierwsze zapytanie w pięć minut

Uzyskaj pierwszą odpowiedź od LLM bez cenzury w mniej niż pięć minut. Ten szybki start pokazuje, jak zastąpić konfigurację klienta OpenAI naszym bazowym URL i kluczem API.

https://api.llamaapis.com/v1uncensored

llamaapis.com

Instalacja

Zacznij od zainstalowania oficjalnego klienta OpenAI dla Pythona. Obsługuje on za Ciebie żądania HTTP i parsowanie JSON.

  • pip install openai

Możesz również użyć SDK JavaScript dla Node.js. Obie biblioteki są w pełni kompatybilne z naszym API, ponieważ ściśle przestrzegamy specyfikacji uzupełniania czatu OpenAI.

Konfiguracja uwierzytelniania

Nasze API używa standardowego uwierzytelniania kluczem API. Po rejestracji w https://llamaapis.com otrzymujesz klucz natychmiast. Nie jest wymagana karta kredytowa dla warstwy próbnej.

Przechowuj ten klucz w zmiennej środowiskowej lub przekaż go bezpośrednio do klienta. Klucz uwierzytelnia wszystkie zapytania do endpointów /v1. Jeśli zgubisz klucz, możesz go wygenerować ponownie z panelu, co natychmiast unieważnia stary.

Podstawowe zapytanie o uzupełnienie czatu

Wyślij zapytanie do endpointu uzupełniania czatu. Musisz ustawić bazowy URL na nasz serwer i podać swój klucz API.

ID modelu to uncensored. Model ten nie stosuje standardowych filtrów treści dla prawnego użytku dorosłego.

Oto jak złożyć proste zapytanie za pomocą curl:

curl https://api.llamaapis.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Odpowiedź zwraca wygenerowany ciąg tekstowy. Jeśli potrzebujesz wywoływania funkcji, struktura jest identyczna z formatem OpenAI.

Odpowiedzi strumieniowe (SSE)

Aby uzyskać wynik w czasie rzeczywistym, włącz strumieniowanie, ustawiając stream: true. Serwer wysyła zdarzenia SSE (Server-Sent Events) zawierające częściowe delta.

Jest to przydatne w interfejsach czatu, gdzie chcesz pokazywać tekst w miarę jego generowania. Okno kontekstu obsługuje do 100 000 tokenów, więc strumieniowanie działa wydajnie nawet przy długich rozmowach.

Przykładowa implementacja strumieniowania:

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Pamiętaj o obsłudze zdarzenia stop, aby zamknąć połączenie w sposób czysty.

Wsparcie dla wywoływania narzędzi/funkcji

Nasze API obsługuje strukturalne wywoływanie narzędzi. Zdefiniuj swoje funkcje w parametrze tools i ustaw model tak, aby odpowiadał wywołaniami funkcji.

Biblioteka klienta automatycznie przeanalizuje argumenty JSON. Działa to dokładnie tak, jak opisano w specyfikacji OpenAI.

Przykład użycia SDK Python:

from openai import OpenAI

client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Model zwróci nazwę funkcji i argumenty. Wykonujesz funkcję i wysyłasz wynik z powrotem w kolejnej wiadomości.

Limity, błędy i kontekst

Bądź świadomy następujących limitów:

  • Limit zapytań: 300 zapytań na minutę na klucz API.
  • Maksymalna treść zapytania: 8 MB.
  • Okno kontekstu: 100 000 tokenów łącznie (wejście + wyjście).

Typowe błędy:

  • 401 Unauthorized: Nieprawidłowy lub brakujący klucz API.
  • 402 Payment Required: Niewystarczający przedpłacony kredyt.
  • 429 Too Many Requests: Przekroczyłeś limit 300 zapytań na minutę.

Nie oferujemy embeddingów, generowania obrazów ani przetwarzania audio. To jest API LLM tylko do tekstu.

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Specyfikacja techniczna

Wszystkie rzeczywiste limity i funkcje API w jednym miejscu — sprawdź je przed doładowaniem.

ElementWartość
Format APIzgodne z OpenAI: działa każdy SDK OpenAI — zmień base URL i klucz
UwierzytelnianieAuthorization: Bearer YOUR_KEY
EndpointyPOST /v1/chat/completions · GET /v1/models
Base URLhttps://api.llamaapis.com/v1
ID modeluuncensored
Okno kontekstu100 000 tokenów (wejście + odpowiedź)
Maks. odpowiedźdo reszty okna 100 000 tokenów; max_tokens opcjonalne (bez osobnego limitu)
Wywoływanie funkcjitak — tools, tool_choice; odpowiedź zawiera tool_calls, także w strumieniu; wyniki jako role: tool
Tryb JSONresponse_format: {"type": "json_object"}
Parametrytemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Strumieniowanietak — server-sent events; ostatni fragment zawiera zużycie tokenów
Limit zapytań300 zapytań na minutę na klucz
Równoległe zapytaniado 8 jednocześnie na klucz
Rozmiar zapytaniado 8 MB
Nagłówki odpowiedziX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Bonus+5% od $50, +10% od $100
Cena$0,25 za 1 mln tokenów wejścia · $1,00 za 1 mln tokenów wyjścia
Rozliczenieprzedpłacony kredyt według rzeczywistego zużycia; błędy i odmowy są darmowe
DoładowanieUSDT (TRC20) lub USDC (Base), dowolna pełna kwota od $10 do $500
Ważnośćopłacony kredyt nie wygasa, bez subskrypcji
Darmowy kredyt$0,50 na 7 dni, bez karty · Klucz próbny: 2 równoległe żądania, 60 na minutę; pełne limity (8 i 300) po pierwszym doładowaniu
Kluczejeden aktywny klucz na konto; nowy zastępuje stary
Treścitreści dla dorosłych dozwolone; treści seksualne z udziałem nieletnich są odrzucane
LogowanieGoogle albo e-mail i hasło

Kody błędów

Błędy wracają jako JSON ze stałym type; nieudane i odrzucone zapytania są bezpłatne.

KodTypZnaczenie
400bad_requestbłędny JSON, puste wiadomości, zły parametr lub za długi kontekst
401missing_key · invalid_key · key_revokedbrak klucza, zły klucz lub klucz zastąpiony nowym
402no_creditbrak kredytu — doładuj, działa od razu
403content_blockedtreści seksualne z nieletnimi — odmowa, bez opłaty
404not_foundnieznany endpoint
413request_too_largetreść większa niż 8 MB
429rate_limited · concurrencyponad 300/min lub 8 równolegle — odczekaj i ponów
503upstream_busymodel zajęty — ponów za kilka sekund

Pytania i odpowiedzi

llamaapis.com
Co się stanie, jeśli wyczerpiesz przedpłacony kredyt?

Twoje zapytania zwrócą błąd 402, dopóki nie doładujesz konta. Możesz dodać środki za kryptowaluty (USDT lub USDC) od kwoty $10. Istniejący przedpłacony kredyt nigdy nie wygasa.

Czy model bez cenzury to model bazowy, czy dostrajany?

To model o otwartych wagach uruchamiany na naszych serwerach GPU, specjalnie dostrojony do odpowiadania bez odmów treści dla prawnego użytku dorosłego. Nie jest bezpośrednią kopią GPT ani Claude.

Czy mogę użyć tego samego kodu SDK, którego używam z OpenAI?

Tak. Zmień <code>base_url</code> na <code>https://api.llamaapis.com/v1</code> i zaktualizuj klucz API. Formaty zapytania i odpowiedzi są kompatybilne.

Twój klucz jest o jeden formularz stąd

Utwórz konto, skopiuj klucz, zmień bazowy URL. To cała konfiguracja.

Pobierz klucz API