채팅 및 LLM
LLM API 가격 비교: GPT, Claude, Gemini, DeepSeek
GPT, Claude, Gemini, DeepSeek, Grok, Kimi의 LLM API 가격을 1M 토큰 기준으로 비교하고, 월 비용 계산 예시와 비용을 줄이는 실용적인 방법을 소개합니다.
"Claude API는 얼마인가요?"라는 질문에는 하나의 답이 없습니다. 요청 단위로 비용을 내는 사람은 없기 때문입니다. 언어 모델 API는 토큰에 과금하며, 토큰이 어느 방향으로 오가느냐에 따라 두세 가지 다른 단가를 적용합니다. 같은 챗봇이라도 어떤 모델에서는 월 $2, 다른 모델에서는 $60가 들 수 있고, 프롬프트 캐싱을 켜는 순간 두 모델의 순위가 뒤집히기도 합니다.
이 가이드는 API Stock 카탈로그에 있는 모든 채팅 모델(GPT, Claude, Gemini, DeepSeek, Grok, Kimi와 그 밖의 몇 가지 모델)의 현재 가격을 나란히 놓고 비교한 뒤, 현실적인 세 가지 워크로드로 계산해 보면서 토큰당 단가가 월 청구 금액에 어떤 의미인지 보여 줍니다. 제품에 넣을 모델을 고르는 개발자, 그리고 "Gemini API 가격"을 검색했지만 계산 예시 하나 없는 표만 찾은 분들을 위해 썼습니다.
실제로 무엇에 비용을 내는가
아래의 모든 가격은 1M(100만) 토큰당 미국 달러 기준입니다. 토큰은 단어의 일부이며, 영어 산문 한 페이지는 수백 토큰 정도입니다. 중요한 단가는 세 가지입니다.
- 입력 토큰: 보내는 모든 것입니다. 시스템 프롬프트, 대화 기록, 검색해 온 문서, 사용자의 메시지가 포함됩니다. 매 턴마다 전체 기록을 다시 보내기 때문에 채팅 워크로드에서는 보통 입력이 대부분을 차지합니다.
- 출력 토큰: 모델이 돌려주는 모든 것입니다. 출력은 언제나 더 비싼 방향이며, 이 카탈로그에서는 같은 모델 입력 단가의 2~6배입니다.
- 캐시 입력: 공급사가 이미 받아서 저장해 둔 프롬프트 부분입니다. 캐시 단가가 있는 모델에서는 캐시된 토큰이 일반 입력 가격의 일부, 보통 10분의 1로 과금됩니다. 일부 모델은 캐시 쓰기 단가도 명시하며, 이는 접두부를 처음 저장할 때 한 번 청구됩니다.
따라서 한 달 청구 금액은 간단히
input × input rate + output × output rate + cached × cache rate + cache writes × cache-write rate를 100만으로 나눈
값입니다. 이 가이드의 나머지는 이 공식에 실제 숫자를 대입하는 과정입니다.
LLM API 가격 한눈에 보기
카탈로그 가격은 2026년 9월 24일에 확인했으며, 1M 토큰당 미국 달러 기준이고 입력 가격 순으로 정렬했습니다. 카탈로그에서 소수점 자릿수가 더 많은 값은 센트 단위로 반올림했습니다. 각 모델 페이지에는 실시간 가격표가 있고, 가격 페이지에서는 모든 모델을 한곳에서 볼 수 있습니다.
| 모델 | 제품군 | 입력 | 출력 | 캐시 입력 |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.168 | $0.336 | — |
| GPT 5.6 Luna | GPT | $0.18 | $1.08 | $0.018 |
| Claude Sonnet 5 | Claude | $0.30 | $1.50 | $0.03 |
| Qwen3.7 Plus | Qwen | $0.34 | $1.37 | $0.034 |
| MiniMax M3 | MiniMax | $0.36 | $1.44 | $0.036 |
| DeepSeek V4 Pro | DeepSeek | $0.522 | $1.044 | — |
| GPT 5.6 Terra | GPT | $0.80 | $4.80 | $0.08 |
| Gemini 3.6 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.7 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.5 Flash | Gemini | $0.90 | $5.40 | $0.09 |
| GLM 5.2 | GLM | $0.98 | $3.43 | $0.098 |
| Kimi K2.7 Code | Kimi | $1.11 | $4.62 | $0.111 |
| GPT 5.5 | GPT | $1.50 | $9.00 | $0.15 |
| Claude Fable 5 | Claude | $1.50 | $7.50 | $0.15 |
| Gemini 3.5 Flash (High) | Gemini | $1.62 | $9.72 | $0.162 |
| GLM 5.3 | GLM | $1.68 | $5.28 | $0.312 |
| Grok 4.5 | Grok | $2.10 | $6.30 | $0.525 |
| Grok 4.6 | Grok | $2.10 | $6.30 | $0.525 |
| GPT 5.6 Sol | GPT | $3.00 | $18.00 | $0.30 |
| Claude Opus 5 | Claude | $3.00 | $15.00 | $0.30 |
| Kimi K3 | Kimi | $3.15 | $15.75 | $0.315 |
| GPT 6 Astra | GPT | $8.00 | $40.00 | $0.80 |
대시(—)는 카탈로그에 해당 모델의 캐시 입력 단가가 없다는 뜻이며, 이 경우 모든 입력 토큰이 정가 입력 가격으로 과금됩니다. 이 가격은 API Stock의 가격이며, 각 공급사가 직접 제공하는 가격과는 별개입니다.
어떤 제품군을 언제 고를까
가격표는 모델을 적합도가 아니라 비용으로 줄 세웁니다. 아래 내용은 숫자가 각 제품군에 대해 말해 주는 것만 다룹니다. 어떤 모델이 원하는 답을 써 주는지는 여러분의 프롬프트로 직접 테스트해 봐야 합니다.
GPT는 여기 있는 제품군 중 가격 폭이 가장 넓습니다. GPT 6 Astra의 입력 가격은 GPT 5.6 Luna의 40배가 넘습니다. 입력 $0.18, 출력 $1.08인 Luna는 카탈로그에서 채팅, 분류, 가벼운 에이전트 단계를 위한 대량 처리 티어로 소개됩니다. Terra는 입력과 출력 모두 GPT 5.5보다 저렴하므로, 새로 연동한다면 더 저렴한 중간급 선택지입니다. 출력은 5.5와 5.6 모델에서 입력의 6×, Astra에서 5×이므로 GPT에서는 답변을 짧게 유지하는 것만으로도 크게 절약할 수 있습니다. 캐시 입력은 제품군 전체에서 입력 단가의 10분의 1입니다.
Claude에는 세 가지 모델이 있으며, Claude Sonnet 5가 단연 가장 저렴합니다. 입력 $0.30, 출력 $1.50입니다. Claude Opus 5는 입력과 출력 모두 정확히 10배 비싸므로, 기본은 Sonnet, 어려운 경우만 Opus로 보내는 라우팅을 첫날부터 만들어 둘 가치가 있습니다. 장문 글쓰기에 맞춰 조정된 Claude Fable 5는 그 중간인 $1.50 / $7.50입니다. 세 모델 모두 출력은 입력의 5×, 캐시 읽기는 입력의 10분의 1, 캐시 쓰기는 입력의 1.25×입니다. Sonnet과 Opus는 OpenAI 호환 엔드포인트와 Anthropic 호환 엔드포인트 모두에서 응답하고, Fable은 Anthropic 호환 Messages 엔드포인트로 제공됩니다.
Gemini는 입력 가격이 동일합니다. 모든 Flash 모델이 입력 100만 토큰당 $0.90입니다. 차이는 출력에 있습니다. 3.6 Flash와 3.7 Flash는 $4.50, 3.5 Flash는 $5.40입니다. High 변형은 3.5 Flash를 큰 추론 예산에 고정한 모델로, 모든 단가가 표준 3.5 Flash의 1.8×입니다. 가격만으로 Gemini 버전을 고른다면 3.6 Flash와 3.7 Flash는 같습니다. 캐시 입력은 입력의 10분의 1입니다.
DeepSeek은 카탈로그에서 가장 저렴한 토큰을 제공합니다. DeepSeek V4 Flash는 입력 $0.168, 출력 $0.336이며, 출력이 입력의 2×에 불과합니다. 여기 있는 모든 모델 중 가장 작은 차이라서 답변이 길어져도 저렴하게 유지됩니다. V4 Pro는 약 3배 비싸지만, $1.044인 출력 단가는 여전히 GPT 5.6 Luna보다 낮습니다. 문제는 캐싱입니다. 카탈로그에는 두 DeepSeek 모델 모두 캐시 단가가 없으며, 이는 프롬프트 비중이 큰 워크로드에서 중요합니다(아래 두 번째 예시 참고).
Grok은 Grok 4.5와 Grok 4.6을 똑같이 $2.10 / $6.30으로 책정하므로, 비용 면에서 4.5에 머물 이유가 없습니다. 출력은 입력의 3×에 불과하지만 캐시 할인은 다른 제품군보다 작습니다. 캐시된 토큰은 입력 단가의 10분의 1이 아니라 4분의 1($0.525)입니다. 두 모델 모두 500K 토큰 컨텍스트로 표기되어 있습니다.
Kimi에는 프런티어 모델과 코딩 티어가 있습니다. Kimi K3는 Claude Opus 5에 가까운 가격($3.15 / $15.75)입니다. 저장소 규모의 편집을 위해 만든 Kimi K2.7 Code는 그 약 3분의 1이며, 캐시 쓰기도 캐시 읽기와 같은 낮은 단가($0.111)로 과금하므로 큰 저장소 컨텍스트를 저장해도 불이익이 없습니다.
카탈로그의 나머지 모델은 DeepSeek과 중간급 사이를 채웁니다. Qwen3.7 Plus와 MiniMax M3는 입력 약 $0.35, 출력 약 $1.40이고, GLM 5.2와 GLM 5.3은 입력 $0.98–$1.68, 출력 $3.43–$5.28입니다.
비용 계산 예시
세 가지 워크로드를 위 카탈로그 가격으로 계산합니다. 합계에는 토큰 요금만 포함됩니다.
1. 고객 지원 봇
한 달에 5,000건의 대화가 있고, 대화마다 약 2,000개의 입력 토큰(시스템 프롬프트, 기록, 고객 메시지)을 보내고 약 400토큰의 답변을 받습니다. 합계 10M 입력 + 2M 출력 토큰입니다.
Claude Sonnet 5에서는 10 × $0.30 + 2 × $1.50 = $3.00 + $3.00으로 계산됩니다.
| 모델 | 입력 | 출력 | 월간 |
|---|---|---|---|
| DeepSeek V4 Flash | $1.68 | $0.67 | $2.35 |
| GPT 5.6 Luna | $1.80 | $2.16 | $3.96 |
| Claude Sonnet 5 | $3.00 | $3.00 | $6.00 |
| DeepSeek V4 Pro | $5.22 | $2.09 | $7.31 |
| GPT 5.6 Terra | $8.00 | $9.60 | $17.60 |
| Gemini 3.7 Flash | $9.00 | $9.00 | $18.00 |
| Grok 4.6 | $21.00 | $12.60 | $33.60 |
| Claude Opus 5 | $30.00 | $30.00 | $60.00 |
출력 토큰 1개당 입력 토큰이 5개인데도 GPT, Claude, Gemini에서는 출력이 청구 금액의 절반 이상을 차지합니다. DeepSeek V4 Flash는 입력과 출력 모두 단가가 가장 낮아 여유 있게 선두를 차지합니다.
2. 큰 고정 프롬프트를 쓰는 어시스턴트
한 제품 어시스턴트가 한 달에 10,000개의 질문에 답합니다. 모든 요청은 지시문과 참고 자료 묶음으로 이루어진 동일한 1,600토큰 블록을 보내고, 그 뒤에 약 400토큰의 질문과 기록이 이어지며, 100토큰의 답변을 받습니다. 프롬프트 캐싱을 켜면 16M 캐시 + 4M 신규 입력 + 1M 출력입니다.
Claude Sonnet 5에서는 16 × $0.03 + 4 × $0.30 + 1 × $1.50 = $0.48 + $1.20 + $1.50입니다.
| 모델 | 캐시 | 신규 입력 | 출력 | 캐시 사용 | 캐시 미사용 |
|---|---|---|---|---|---|
| GPT 5.6 Luna | $0.29 | $0.72 | $1.08 | $2.09 | $4.68 |
| Claude Sonnet 5 | $0.48 | $1.20 | $1.50 | $3.18 | $7.50 |
| DeepSeek V4 Flash | — | $3.36 | $0.34 | $3.70 | $3.70 |
| GPT 5.6 Terra | $1.28 | $3.20 | $4.80 | $9.28 | $20.80 |
| Gemini 3.7 Flash | $1.44 | $3.60 | $4.50 | $9.54 | $22.50 |
| Grok 4.6 | $8.40 | $8.40 | $6.30 | $23.10 | $48.30 |
| Claude Opus 5 | $4.80 | $12.00 | $15.00 | $31.80 | $75.00 |
바로 여기서 순위가 뒤집힙니다. 캐싱이 없으면 DeepSeek V4 Flash가 가장 저렴하지만, 캐싱을 켜면 GPT 5.6 Luna와 Claude Sonnet 5가 모두 더 저렴해집니다. DeepSeek은 20M 입력 토큰 전부를 정가로 과금하기 때문입니다. 캐싱은 여기 있는 GPT, Claude, Gemini 모델에서 청구 금액을 55–58% 줄이고, 캐시 토큰이 10분의 1이 아니라 4분의 1인 Grok에서는 약 52% 줄입니다. 표에는 캐시 쓰기 단가가 있는 모델의 1회성 캐시 쓰기 요금이 빠져 있지만, 수천 번 재사용하는 접두부라면 반올림 오차 수준입니다.
3. 일괄 요약 작업
약 8,000토큰짜리 문서 5,000개를 각각 400토큰 분량의 요약으로 만듭니다. 문서가 모두 달라서 캐시할 것이 없습니다. 40M 입력 + 2M 출력입니다.
| 모델 | 입력 | 출력 | 작업 |
|---|---|---|---|
| DeepSeek V4 Flash | $6.72 | $0.67 | $7.39 |
| GPT 5.6 Luna | $7.20 | $2.16 | $9.36 |
| Claude Sonnet 5 | $12.00 | $3.00 | $15.00 |
| Qwen3.7 Plus | $13.72 | $2.74 | $16.46 |
| MiniMax M3 | $14.40 | $2.88 | $17.28 |
| DeepSeek V4 Pro | $20.88 | $2.09 | $22.97 |
| GPT 5.6 Terra | $32.00 | $9.60 | $41.60 |
| Gemini 3.7 Flash | $36.00 | $9.00 | $45.00 |
여기서는 입력이 출력의 20배이므로 입력 단가가 거의 모든 것을 결정합니다. 문서 100개 정도를 샘플로 두세 후보 모델에 돌려 요약을 비교하고, 전체 비용을 곱해 본 다음에 배치 전체를 실행하세요.
비용을 줄이는 방법
- 반복되는 모든 내용에 프롬프트 캐싱을 켜세요. 지시문, 도구 정의, 참고 자료처럼 프롬프트에서 변하지 않는 부분을 앞에, 바뀌는 부분을 뒤에 두어 요청마다 접두부가 똑같이 유지되게 합니다. 캐시 단가가 있는 모델이라면 캐시된 토큰은 그 단가로 과금됩니다. 단계마다 점점 커지는 컨텍스트를 다시 보내는 코딩 에이전트와 멀티턴 채팅이 가장 큰 혜택을 봅니다.
- 출력에 상한을 두세요. 출력은 비싼 방향이므로
max_tokens를 설정하고, 라벨 하나, JSON 객체, 글머리표 세 개처럼 필요한 형식을 요청하세요. "짧게 답해 달라"고 해도 얼마나 짧아야 하는지는 여전히 모델이 정합니다. - 초안은 저렴하게, 마무리는 비싸게. 분류, 추출, 초안, 라우팅에는 DeepSeek V4 Flash, GPT 5.6 Luna, Claude Sonnet 5 같은 저가 티어를 쓰고, 꼭 필요한 요청만 Opus, Sol, Astra로 보내세요. 10× 가격 차이라면 요청 10건 중 1건을 상위 모델로 올리는 라우터도 모든 요청을 최상위 모델에 보내는 비용의 절반보다 훨씬 적게 듭니다.
- 다시 보내는 내용을 줄이세요. 전체 기록을 다시 재생하는 대신 오래된 턴을 요약하고, 더 적지만 더 좋은 청크를 검색해 오세요. 보내지 않은 토큰은 캐시 여부와 상관없이 비용이 들지 않습니다.
- 자신의 트래픽으로 비교하세요. 계산 예시에서 보듯 가장 저렴한 모델은 입력/출력
비율과 캐싱 여부에 따라 달라집니다. 실제 요청 하루치의
usage를 기록하고 두세 모델 기준으로 비용을 계산해 보세요.
키 하나로 모든 모델 호출하기
표에 있는 모든 모델은 API Stock 키 하나와 선불 잔액 하나로 실행됩니다. 이 잔액은 동영상, 이미지, 음악 생성에도 똑같이 쓰입니다. 구독도, 공급사별 계정도 필요 없습니다. 잔액을 충전하면 각 요청이 사용한 토큰만큼 차감됩니다. 공급사에서 실패하면 요청을 예비 공급사에서 재시도하며, 모든 곳에서 실패한 요청은 환불됩니다.
OpenAI 호환 엔드포인트는 POST /api/v1/chat/completions입니다. 공식 OpenAI SDK를
사용한다면 base URL을 API Stock으로 지정하고 API Stock 키를 쓰면 됩니다. 모델을
바꿀 때는 model 문자열만 바꾸면 됩니다.
import OpenAI from "openai";const client = new OpenAI({apiKey: process.env.API_STOCK_KEY,baseURL: "https://api.api-stock.com/api/v1",});const completion = await client.chat.completions.create({model: "deepseek-v4-flash", // 또는 "gpt-5.6-luna", "claude-sonnet-5", "gemini-3.7-flash"…max_tokens: 300,messages: [{ role: "system", content: "You are a concise support assistant." },{ role: "user", content: "How do I reset my password?" },],});console.log(completion.choices[0].message.content);console.log(completion.usage); // 이 요청의 과금 기준이 되는 토큰 수
Anthropic 호환 엔드포인트는 POST /api/v1/messages입니다. Anthropic 요청 형식을
받으며, 여기서는 max_tokens가 필수입니다.
curl -X POST https://api.api-stock.com/api/v1/messages \-H "Authorization: Bearer $API_STOCK_KEY" \-H "Content-Type: application/json" \-d '{"model": "claude-sonnet-5","max_tokens": 300,"messages": [{ "role": "user", "content": "How do I reset my password?" }]}'
파라미터, 스트리밍, 오류 처리는 Chat Completions 레퍼런스와 Messages 레퍼런스에 있습니다. 서비스를 공개하기 전에는 프로덕션 체크리스트에서 키 관리와 잔액 모니터링을 확인하세요.
자주 묻는 질문
Gemini API는 얼마인가요?
카탈로그 가격 기준으로 모든 Gemini Flash 모델은 입력 100만 토큰당 $0.90입니다. 출력은 100만 토큰당 Gemini 3.6 Flash와 3.7 Flash가 $4.50, 3.5 Flash가 $5.40, 3.5 Flash (High)가 $9.72입니다. 캐시 입력은 100만 토큰당 $0.09(High는 $0.162)입니다. 실시간 가격은 Gemini 제품군 페이지에서 확인할 수 있습니다.
Claude API는 얼마인가요?
Claude Sonnet 5는 입력 100만 토큰당 $0.30, 출력 100만 토큰당 $1.50이고, Claude Fable 5는 $1.50 / $7.50, Claude Opus 5는 $3 / $15입니다. 세 모델 모두 캐시 입력은 입력 단가의 10분의 1입니다. 최신 가격표는 Claude 제품군 페이지를 참고하세요.
DeepSeek이 가장 저렴한 LLM API인가요?
토큰당으로는 그렇습니다. 입력 $0.168, 출력 $0.336인 DeepSeek V4 Flash가 카탈로그에서 가장 저렴한 모델입니다. 하지만 프롬프트의 대부분을 캐시할 수 있다면 DeepSeek에는 캐시 단가가 없기 때문에 GPT 5.6 Luna와 Claude Sonnet 5가 더 저렴해질 수 있습니다. 얼마나 차이 나는지는 위의 두 번째 계산 예시에서 볼 수 있습니다.
Claude, Gemini, DeepSeek API 키는 어떻게 받나요?
공급사마다 키를 따로 받을 필요가 없습니다. API Stock에 가입하고 원하는 금액만큼 잔액을 충전한 뒤 대시보드에서 API 키를 만드세요. 같은 키로 GPT, Claude, Gemini, DeepSeek, Grok, Kimi를 비롯해 카탈로그의 모든 모델을 호출할 수 있습니다.
내 워크로드에는 어떤 LLM API가 가장 저렴한가요?
위 예시처럼 월간 입력, 출력, 캐시 토큰 수에 각 후보 모델의 단가를 곱해 보세요. 프롬프트가 짧고 답변이 길다면 출력 단가가 낮은 모델이, 긴 프롬프트를 반복해서 보낸다면 캐시 단가가 저렴한 모델이, 한 번만 처리하는 긴 문서라면 입력 단가가 낮은 모델이 유리합니다. 가격 페이지와 GPT, Claude, Gemini, DeepSeek, Grok, Kimi 제품군 페이지부터 살펴보세요.
직접 발급한 키로 실행해 보세요
이 가이드에 나오는 모델은 모두 API Stock 카탈로그에서 바로 쓸 수 있습니다. API 키 하나, 선불 잔액 하나면 되고 공급자별 가입은 필요 없습니다.