홈/문서
Llama API: 5분 내 첫 요청
5분 이내에 무검열 LLM에서 첫 응답을 받으세요. 이 빠른 시작 가이드는 기존 OpenAI 클라이언트 구성을 기본 URL과 API 키로 교체하는 방법을 보여줍니다.
https://api.llamaapis.com/v1uncensored
설치
공식 OpenAI Python 클라이언트를 설치하세요. HTTP 요청 및 JSON 파싱을 처리합니다.
- pip install openai
Node.js용 JavaScript SDK도 사용할 수 있습니다. 두 라이브러리 모두 OpenAI 채팅 완성 사양을 정확히 따르기 때문에 당사 API와 완전히 호환됩니다.
인증 설정
당사 API는 표준 API 키 인증을 사용합니다. https://llamaapis.com에서 가입하면 즉시 키를 받습니다. 체험 등급에는 신용카드가 필요하지 않습니다.
이 키를 환경 변수에 저장하거나 클라이언트에 직접 전달하세요. 이 키는 /v1 엔드포인트로의 모든 요청을 인증합니다. 키를 분실하면 대시보드에서 재생성할 수 있으며, 기존 키는 즉시 무효화됩니다.
기본 채팅 완성 요청
채팅 완성 엔드포인트로 요청을 보내세요. 기본 URL을 당사 서버로 설정하고 API 키를 제공해야 합니다.
모델 ID는 uncensored입니다. 이 모델은 법적인 성인 용도로 표준 콘텐츠 필터를 적용하지 않습니다.
curl을 사용한 간단한 요청 방법은 다음과 같습니다:
curl https://api.llamaapis.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'응답은 생성된 텍스트 문자열을 반환합니다. 함수 호출이 필요한 경우 구조는 OpenAI 형식과 동일합니다.
스트리밍 응답(SSE)
실시간 출력을 위해 stream: true를 설정하여 스트리밍을 활성화하세요. 서버는 부분 델타를 포함하는 서버 전송 이벤트(SSE)를 보냅니다.
텍스트가 생성되는 대로 표시하려는 채팅 인터페이스에 유용합니다. 컨텍스트 창은 최대 100,000 토큰을 지원하므로 긴 대화에서도 스트리밍이 효율적으로 작동합니다.
스트리밍 구현 예시:
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)stop 이벤트를 처리하여 연결을 깔끔하게 종료하세요.
도구/함수 호출 지원
당사 API는 구조화된 도구 호출을 지원합니다. tools 매개변수에 함수를 정의하고 모델이 함수 호출로 응답하도록 설정하세요.
클라이언트 라이브러리는 JSON 인수를 자동으로 구문 분석합니다. 이는 OpenAI 사양에 문서화된 방식과 정확히 동일하게 작동합니다.
Python SDK 사용 예시:
from openai import OpenAI
client = OpenAI(base_url="https://api.llamaapis.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)모델은 함수 이름과 인수를 반환합니다. 함수를 실행한 후 결과를 다음 메시지로 보냅니다.
제한, 오류 및 컨텍스트
다음 제한 사항을 유의하세요:
- 속도 제한: API 키당 분당 300개 요청.
- 최대 요청 본문: 8 MB.
- 컨텍스트 창: 총 100,000 토큰(입력 + 출력).
일반적인 오류:
- 401 Unauthorized: 유효하지 않거나 누락된 API 키.
- 402 Payment Required: 선불 크레딧 부족.
- 429 Too Many Requests: 분당 300개 제한을 초과했습니다.
임베딩, 이미지 생성 또는 오디오 처리를 제공하지 않습니다. 이는 텍스트 전용 LLM API입니다.
Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llamaapis.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);기술 사양
크레딧을 구매하기 전에 확인할 수 있도록 API의 실제 한도와 기능을 한곳에 정리했습니다.
| 항목 | 내용 |
|---|---|
| 형식 | OpenAI 호환: 어떤 OpenAI SDK든 base URL과 키만 바꾸면 동작 |
| 인증 | Authorization: Bearer YOUR_KEY |
| 엔드포인트 | POST /v1/chat/completions · GET /v1/models |
| Base URL | https://api.llamaapis.com/v1 |
| 모델 ID | uncensored |
| 컨텍스트 창 | 100,000 토큰 (입력 + 출력) |
| 최대 출력 | 100,000 토큰 윈도우의 남은 만큼; max_tokens는 선택 사항(별도 상한 없음) |
| 함수 호출 | 지원 — tools, tool_choice; 응답에 tool_calls (스트리밍 포함), 결과는 role: tool로 전송 |
| JSON 모드 | response_format: {"type": "json_object"} |
| 파라미터 | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| 스트리밍 | 지원 — SSE, 마지막 청크에 토큰 사용량 포함 |
| 속도 제한 | 키당 분당 300회 |
| 동시 요청 | 키당 동시 8개 |
| 요청 크기 | 최대 8 MB |
| 응답 헤더 | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| 보너스 | $50 이상 +5%, $100 이상 +10% |
| 가격 | 입력 100만 토큰당 $0.25 · 출력 100만 토큰당 $1.00 |
| 과금 | 선불 크레딧에서 실제 사용량만큼 차감, 오류·거부는 무료 |
| 충전 | USDT (TRC20) 또는 USDC (Base), $10~$500 사이 원하는 정수 금액 |
| 유효기간 | 유료 크레딧은 만료되지 않으며 구독 없음 |
| 무료 체험 | $0.50, 7일, 카드 불필요 · 체험 키: 동시 요청 2건, 분당 60건. 첫 충전 후 전체 한도(8건, 300건) 적용 |
| 키 | 계정당 활성 키 1개, 새 키를 만들면 이전 키는 무효 |
| 콘텐츠 | 성인 콘텐츠 허용, 미성년자가 관련된 성적 콘텐츠는 거부 |
| 로그인 | Google 또는 이메일과 비밀번호 |
오류 코드
오류는 고정된 type을 가진 JSON으로 반환되며, 실패하거나 거부된 요청은 과금되지 않습니다.
| 코드 | 유형 | 의미 |
|---|---|---|
400 | bad_request | 잘못된 JSON, 빈 메시지, 잘못된 파라미터 또는 컨텍스트 초과 |
401 | missing_key · invalid_key · key_revoked | 키 없음·잘못됨·새 키로 교체됨 |
402 | no_credit | 잔액 없음 — 충전하면 즉시 재개 |
403 | content_blocked | 미성년자 관련 성적 콘텐츠 — 거부, 과금 없음 |
404 | not_found | 알 수 없는 엔드포인트 |
413 | request_too_large | 본문 8 MB 초과 |
429 | rate_limited · concurrency | 분당 300회 또는 동시 8개 초과 — 잠시 후 재시도 |
503 | upstream_busy | 모델 혼잡 — 몇 초 후 재시도 |
질문과 답변
선불 크레딧을 초과하면 어떻게 되나요?
계정을 충전할 때까지 요청에 402 오류가 반환됩니다. 10달러부터 시작하여 암호화폐(USDT 또는 USDC)로 크레딧을 추가할 수 있습니다. 기존 선불 크레딧은 만료되지 않습니다.
무검열 모델은 파인튜닝된 것인가요, 기본 모델인가요?
법적인 성인 용도로 콘텐츠 거부 없이 답변하도록 특별히 조정된 오픈 웨이트 모델로, 자체 GPU 서버에서 실행됩니다. GPT나 Claude의 직접적인 복제본이 아닙니다.
OpenAI에서 사용하는 SDK 코드를 사용할 수 있나요?
네. <code>base_url</code>을 <code>https://api.llamaapis.com/v1</code>로 변경하고 API 키를 업데이트하세요. 요청 및 응답 형식은 호환됩니다.
키는 양식 하나만 작성하면 받을 수 있습니다
계정을 생성하고 키를 복사한 후 기본 URL을 변경하세요. 설정은 이것으로 끝입니다.