Strona główna/Dokumentacja
API Llamy: pierwsze zapytanie w pięć minut
Uzyskaj pierwszą odpowiedź od LLM bez cenzury w mniej niż pięć minut. Ten szybki start pokazuje, jak zastąpić konfigurację klienta OpenAI naszym bazowym URL i kluczem API.
https://api.llamaapis.com/v1uncensored
Instalacja
Zacznij od zainstalowania oficjalnego klienta OpenAI dla Pythona. Obsługuje on za Ciebie żądania HTTP i parsowanie JSON.
- pip install openai
Możesz również użyć SDK JavaScript dla Node.js. Obie biblioteki są w pełni kompatybilne z naszym API, ponieważ ściśle przestrzegamy specyfikacji uzupełniania czatu OpenAI.
Konfiguracja uwierzytelniania
Nasze API używa standardowego uwierzytelniania kluczem API. Po rejestracji w https://llamaapis.com otrzymujesz klucz natychmiast. Nie jest wymagana karta kredytowa dla warstwy próbnej.
Przechowuj ten klucz w zmiennej środowiskowej lub przekaż go bezpośrednio do klienta. Klucz uwierzytelnia wszystkie zapytania do endpointów /v1. Jeśli zgubisz klucz, możesz go wygenerować ponownie z panelu, co natychmiast unieważnia stary.
Podstawowe zapytanie o uzupełnienie czatu
Wyślij zapytanie do endpointu uzupełniania czatu. Musisz ustawić bazowy URL na nasz serwer i podać swój klucz API.
ID modelu to uncensored. Model ten nie stosuje standardowych filtrów treści dla prawnego użytku dorosłego.
Oto jak złożyć proste zapytanie za pomocą curl:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Odpowiedź zwraca wygenerowany ciąg tekstowy. Jeśli potrzebujesz wywoływania funkcji, struktura jest identyczna z formatem OpenAI.
Odpowiedzi strumieniowe (SSE)
Aby uzyskać wynik w czasie rzeczywistym, włącz strumieniowanie, ustawiając stream: true. Serwer wysyła zdarzenia SSE (Server-Sent Events) zawierające częściowe delta.
Jest to przydatne w interfejsach czatu, gdzie chcesz pokazywać tekst w miarę jego generowania. Okno kontekstu obsługuje do 100 000 tokenów, więc strumieniowanie działa wydajnie nawet przy długich rozmowach.
Przykładowa implementacja strumieniowania:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Pamiętaj o obsłudze zdarzenia stop, aby zamknąć połączenie w sposób czysty.
Wsparcie dla wywoływania narzędzi/funkcji
Nasze API obsługuje strukturalne wywoływanie narzędzi. Zdefiniuj swoje funkcje w parametrze tools i ustaw model tak, aby odpowiadał wywołaniami funkcji.
Biblioteka klienta automatycznie przeanalizuje argumenty JSON. Działa to dokładnie tak, jak opisano w specyfikacji OpenAI.
Przykład użycia SDK Python:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Model zwróci nazwę funkcji i argumenty. Wykonujesz funkcję i wysyłasz wynik z powrotem w kolejnej wiadomości.
Limity, błędy i kontekst
Bądź świadomy następujących limitów:
- Limit zapytań: 300 zapytań na minutę na klucz API.
- Maksymalna treść zapytania: 8 MB.
- Okno kontekstu: 100 000 tokenów łącznie (wejście + wyjście).
Typowe błędy:
- 401 Unauthorized: Nieprawidłowy lub brakujący klucz API.
- 402 Payment Required: Niewystarczający przedpłacony kredyt.
- 429 Too Many Requests: Przekroczyłeś limit 300 zapytań na minutę.
Nie oferujemy embeddingów, generowania obrazów ani przetwarzania audio. To jest API LLM tylko do tekstu.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Specyfikacja techniczna
Wszystkie rzeczywiste limity i funkcje API w jednym miejscu — sprawdź je przed doładowaniem.
| Element | Wartość |
|---|---|
| Format API | zgodne z OpenAI: działa każdy SDK OpenAI — zmień base URL i klucz |
| Uwierzytelnianie | Authorization: Bearer YOUR_KEY |
| Endpointy | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| ID modelu | uncensored |
| Okno kontekstu | 100 000 tokenów (wejście + odpowiedź) |
| Maks. odpowiedź | do reszty okna 100 000 tokenów; max_tokens opcjonalne (bez osobnego limitu) |
| Wywoływanie funkcji | tak — tools, tool_choice; odpowiedź zawiera tool_calls, także w strumieniu; wyniki jako role: tool |
| Tryb JSON | response_format: {"type": "json_object"} |
| Parametry | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Strumieniowanie | tak — server-sent events; ostatni fragment zawiera zużycie tokenów |
| Limit zapytań | 300 zapytań na minutę na klucz |
| Równoległe zapytania | do 8 jednocześnie na klucz |
| Rozmiar zapytania | do 8 MB |
| Nagłówki odpowiedzi | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Bonus | +5% od $50, +10% od $100 |
| Cena | $0,25 za 1 mln tokenów wejścia · $1,00 za 1 mln tokenów wyjścia |
| Rozliczenie | przedpłacony kredyt według rzeczywistego zużycia; błędy i odmowy są darmowe |
| Doładowanie | USDT (TRC20) lub USDC (Base), dowolna pełna kwota od $10 do $500 |
| Ważność | opłacony kredyt nie wygasa, bez subskrypcji |
| Darmowy kredyt | $0,50 na 7 dni, bez karty · Klucz próbny: 2 równoległe żądania, 60 na minutę; pełne limity (8 i 300) po pierwszym doładowaniu |
| Klucze | jeden aktywny klucz na konto; nowy zastępuje stary |
| Treści | treści dla dorosłych dozwolone; treści seksualne z udziałem nieletnich są odrzucane |
| Logowanie | Google albo e-mail i hasło |
Kody błędów
Błędy wracają jako JSON ze stałym type; nieudane i odrzucone zapytania są bezpłatne.
| Kod | Typ | Znaczenie |
|---|---|---|
400 | bad_request | błędny JSON, puste wiadomości, zły parametr lub za długi kontekst |
401 | missing_key · invalid_key · key_revoked | brak klucza, zły klucz lub klucz zastąpiony nowym |
402 | no_credit | brak kredytu — doładuj, działa od razu |
403 | content_blocked | treści seksualne z nieletnimi — odmowa, bez opłaty |
404 | not_found | nieznany endpoint |
413 | request_too_large | treść większa niż 8 MB |
429 | rate_limited · concurrency | ponad 300/min lub 8 równolegle — odczekaj i ponów |
503 | upstream_busy | model zajęty — ponów za kilka sekund |
Pytania i odpowiedzi
Co się stanie, jeśli wyczerpiesz przedpłacony kredyt?
Twoje zapytania zwrócą błąd 402, dopóki nie doładujesz konta. Możesz dodać środki za kryptowaluty (USDT lub USDC) od kwoty $10. Istniejący przedpłacony kredyt nigdy nie wygasa.
Czy model bez cenzury to model bazowy, czy dostrajany?
To model o otwartych wagach uruchamiany na naszych serwerach GPU, specjalnie dostrojony do odpowiadania bez odmów treści dla prawnego użytku dorosłego. Nie jest bezpośrednią kopią GPT ani Claude.
Czy mogę użyć tego samego kodu SDK, którego używam z OpenAI?
Tak. Zmień <code>base_url</code> na <code>https://api.llamaapis.com/v1</code> i zaktualizuj klucz API. Formaty zapytania i odpowiedzi są kompatybilne.
Twój klucz jest o jeden formularz stąd
Utwórz konto, skopiuj klucz, zmień bazowy URL. To cała konfiguracja.