对话与 LLM
LLM API 价格对比:GPT、Claude、Gemini、DeepSeek
对比 GPT、Claude、Gemini、DeepSeek、Grok 和 Kimi 每 1M tokens 的 LLM API 价格,附月度成本测算示例和切实可行的省钱方法。
「Claude API 多少钱?」这个问题没有唯一答案,因为没有人按请求付费。语言模型 API 按 token 计费,而且根据 token 的流向,会按两到三种不同的单价计费。同一个聊天机器人,换一个模型每月可能只要 $2,换另一个则要 $60;而一旦开启提示词缓存,两个模型之间的排名甚至可能反转。
本指南把 API Stock 目录中所有对话模型的当前价格并排列出——GPT、Claude、Gemini、DeepSeek、Grok、Kimi 以及其他几个模型——然后用三个贴近实际的工作负载进行测算,让你看清每 token 的单价落到月度账单上意味着什么。本文写给正在为产品选型的开发者,也写给每一个搜过「Gemini API 价格」、却只找到一张表格而没有任何测算示例的人。
你实际在为什么付费
下文所有价格均为 每 1M(100 万)tokens 的美元价格。一个 token 大约是一个词的一部分,一页英文文章大约几百个 token。需要关注的单价有三种:
- 输入 tokens——你发送的一切:系统提示词、对话历史、检索到的文档以及用户的消息。每一轮都要重新发送完整的历史,这就是聊天类负载中输入通常占大头的原因。
- 输出 tokens——模型写回的一切。输出永远是更贵的方向:在本目录中,输出单价是同一模型输入单价的 2 到 6 倍。
- 缓存输入——服务商已经见过并存储下来的那部分提示词。对于有缓存价格的模型,缓存 token 只按正常输入价格的一小部分计费,通常是十分之一。部分模型还列出了缓存写入 价格,在前缀首次存储时收取一次。
所以一个月的账单就是 input × input rate + output × output rate + cached × cache rate + cache writes × cache-write rate,再除以一百万。本指南其余部分,就是用真实数字套用这个公式。
LLM API 价格一览
目录价格核对于 2026 年 9 月 24 日,单位为每 1M tokens 美元,按输入价格排序。目录中小数位更多的数字已四舍五入到美分。每个模型页面都有实时价格表,价格页面 则把所有模型集中列在一处。
| 模型 | 系列 | 输入 | 输出 | 缓存输入 |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.168 | $0.336 | — |
| GPT 5.6 Luna | GPT | $0.18 | $1.08 | $0.018 |
| Claude Sonnet 5 | Claude | $0.30 | $1.50 | $0.03 |
| Qwen3.7 Plus | Qwen | $0.34 | $1.37 | $0.034 |
| MiniMax M3 | MiniMax | $0.36 | $1.44 | $0.036 |
| DeepSeek V4 Pro | DeepSeek | $0.522 | $1.044 | — |
| GPT 5.6 Terra | GPT | $0.80 | $4.80 | $0.08 |
| Gemini 3.6 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.7 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.5 Flash | Gemini | $0.90 | $5.40 | $0.09 |
| GLM 5.2 | GLM | $0.98 | $3.43 | $0.098 |
| Kimi K2.7 Code | Kimi | $1.11 | $4.62 | $0.111 |
| GPT 5.5 | GPT | $1.50 | $9.00 | $0.15 |
| Claude Fable 5 | Claude | $1.50 | $7.50 | $0.15 |
| Gemini 3.5 Flash (High) | Gemini | $1.62 | $9.72 | $0.162 |
| GLM 5.3 | GLM | $1.68 | $5.28 | $0.312 |
| Grok 4.5 | Grok | $2.10 | $6.30 | $0.525 |
| Grok 4.6 | Grok | $2.10 | $6.30 | $0.525 |
| GPT 5.6 Sol | GPT | $3.00 | $18.00 | $0.30 |
| Claude Opus 5 | Claude | $3.00 | $15.00 | $0.30 |
| Kimi K3 | Kimi | $3.15 | $15.75 | $0.315 |
| GPT 6 Astra | GPT | $8.00 | $40.00 | $0.80 |
破折号表示目录中没有列出该模型的缓存输入价格,因此所有输入 token 都按完整输入价格计费。以上均为 API Stock 的价格,与各厂商自身的直连定价无关。
选哪个系列,何时选
价格表按成本给模型排序,而不是按适配度。下面的说明只讲数字能说明的内容;哪个模型能写出你需要的回答,要用你自己的提示词去测试。
GPT 是这里价格跨度最大的系列:GPT 6 Astra 的输入价格是 GPT 5.6 Luna 的 40 多倍。Luna 输入 $0.18、输出 $1.08,在目录中被定位为面向聊天、分类和轻量级智能体步骤的大批量档位。Terra 的输入和输出价格都低于 GPT 5.5,因此对于新接入的项目,它是更便宜的中端选择。5.5 和 5.6 模型的输出价格是输入的 6×,Astra 是 5×——在 GPT 上把回答控制得短一些,省下的钱相当可观。整个系列的缓存输入都是输入价格的十分之一。
Claude 有三个模型,其中 Claude Sonnet 5 遥遥领先地最便宜:输入 $0.30,输出 $1.50。Claude Opus 5 在输入和输出两侧都恰好贵十倍,因此从第一天起就值得搭建路由——默认用 Sonnet,难题交给 Opus。专为长篇写作调优的 Claude Fable 5 介于两者之间,价格为 $1.50 / $7.50。三个模型的输出都是输入的 5×,缓存读取是输入的十分之一,缓存写入为输入的 1.25×。Sonnet 和 Opus 同时支持 OpenAI 兼容端点和 Anthropic 兼容端点;Fable 则通过 Anthropic 兼容的 Messages 端点提供。
Gemini 的输入价格是统一的:每个 Flash 模型都是每百万输入 tokens $0.90。区别在输出——3.6 Flash 和 3.7 Flash 收 $4.50,3.5 Flash 收 $5.40。High 版本 把 3.5 Flash 固定在较大的推理预算上,每一项价格都是标准 3.5 Flash 的 1.8×。如果只按价格在 Gemini 各版本之间选择,3.6 和 3.7 Flash 完全相同。缓存输入是输入的十分之一。
DeepSeek 拥有目录中最便宜的 tokens。DeepSeek V4 Flash 输入 $0.168、输出 $0.336,其输出只是输入的 2×——这是这里所有模型中差距最小的,所以即使回答很长也依然便宜。V4 Pro 大约贵三倍,但它 $1.044 的输出价格仍低于 GPT 5.6 Luna。问题在于缓存:目录中两款 DeepSeek 模型都没有列出缓存价格,这对提示词占比很重的负载影响很大(见下文第二个示例)。
Grok 的 Grok 4.5 和 Grok 4.6 定价完全相同,都是 $2.10 / $6.30,因此没有任何成本上的理由继续留在 4.5。输出只是输入的 3×,但缓存折扣比其他系列小:缓存 token 的价格是输入价格的 四分之一($0.525),而不是十分之一。两者都标注为 500K tokens 上下文。
Kimi 有一个前沿模型和一个编程档位。Kimi K3 的定价接近 Claude Opus 5($3.15 / $15.75)。为仓库级修改打造的 Kimi K2.7 Code 价格约为它的三分之一,而且缓存写入与缓存读取按同样的低价计费($0.111),所以存储大型仓库上下文不会被额外惩罚。
目录中的其他模型填补了 DeepSeek 与中端之间的空档:Qwen3.7 Plus 和 MiniMax M3 大约输入 $0.35、输出 $1.40,而 GLM 5.2 和 GLM 5.3 的输入为 $0.98–$1.68,输出为 $3.43–$5.28。
成本测算示例
三个工作负载,按上表的目录价格计算。合计只包含 token 费用。
1. 客服机器人
每月 5,000 次对话,每次发送约 2,000 个输入 tokens(系统提示词、历史记录、客户的消息),收到约 400 tokens 的回答。合计 10M 输入 + 2M 输出 tokens。
在 Claude Sonnet 5 上的算式是 10 × $0.30 + 2 × $1.50 = $3.00 + $3.00。
| 模型 | 输入 | 输出 | 每月 |
|---|---|---|---|
| DeepSeek V4 Flash | $1.68 | $0.67 | $2.35 |
| GPT 5.6 Luna | $1.80 | $2.16 | $3.96 |
| Claude Sonnet 5 | $3.00 | $3.00 | $6.00 |
| DeepSeek V4 Pro | $5.22 | $2.09 | $7.31 |
| GPT 5.6 Terra | $8.00 | $9.60 | $17.60 |
| Gemini 3.7 Flash | $9.00 | $9.00 | $18.00 |
| Grok 4.6 | $21.00 | $12.60 | $33.60 |
| Claude Opus 5 | $30.00 | $30.00 | $60.00 |
即使每 1 个输出 token 对应 5 个输入 token,在 GPT、Claude 和 Gemini 上输出仍占账单的一半甚至更多。DeepSeek V4 Flash 两侧单价都最低,因此轻松领先。
2. 带有大型固定提示词的助手
一个产品助手每月回答 10,000 个问题。每个请求都发送相同的 1,600 tokens 内容块——指令加一份参考资料——后面是约 400 tokens 的问题和历史记录,并得到 100 tokens 的回答。开启提示词缓存后,合计为 16M 缓存 + 4M 新输入 + 1M 输出。
在 Claude Sonnet 5 上:16 × $0.03 + 4 × $0.30 + 1 × $1.50 = $0.48 + $1.20 + $1.50。
| 模型 | 缓存 | 新输入 | 输出 | 开启缓存 | 不开缓存 |
|---|---|---|---|---|---|
| GPT 5.6 Luna | $0.29 | $0.72 | $1.08 | $2.09 | $4.68 |
| Claude Sonnet 5 | $0.48 | $1.20 | $1.50 | $3.18 | $7.50 |
| DeepSeek V4 Flash | — | $3.36 | $0.34 | $3.70 | $3.70 |
| GPT 5.6 Terra | $1.28 | $3.20 | $4.80 | $9.28 | $20.80 |
| Gemini 3.7 Flash | $1.44 | $3.60 | $4.50 | $9.54 | $22.50 |
| Grok 4.6 | $8.40 | $8.40 | $6.30 | $23.10 | $48.30 |
| Claude Opus 5 | $4.80 | $12.00 | $15.00 | $31.80 | $75.00 |
排名就是在这里反转的。不开缓存时 DeepSeek V4 Flash 最便宜;开启缓存后,GPT 5.6 Luna 和 Claude Sonnet 5 都比它更便宜,因为 DeepSeek 对全部 20M 输入 tokens 都按全价计费。在这里的 GPT、Claude 和 Gemini 模型上,缓存能把账单削减 55–58%;在 Grok 上约为 52%,因为它的缓存 token 价格是四分之一而不是十分之一。表中没有计入列有缓存写入价格的模型的一次性缓存写入费用;对于被复用数千次的前缀来说,这笔钱可以忽略不计。
3. 批量摘要任务
你要把 5,000 份各约 8,000 tokens 的文档摘要成 400 tokens 的简报。每份文档都不同,所以没有可缓存的内容:40M 输入 + 2M 输出。
| 模型 | 输入 | 输出 | 任务 |
|---|---|---|---|
| DeepSeek V4 Flash | $6.72 | $0.67 | $7.39 |
| GPT 5.6 Luna | $7.20 | $2.16 | $9.36 |
| Claude Sonnet 5 | $12.00 | $3.00 | $15.00 |
| Qwen3.7 Plus | $13.72 | $2.74 | $16.46 |
| MiniMax M3 | $14.40 | $2.88 | $17.28 |
| DeepSeek V4 Pro | $20.88 | $2.09 | $22.97 |
| GPT 5.6 Terra | $32.00 | $9.60 | $41.60 |
| Gemini 3.7 Flash | $36.00 | $9.00 | $45.00 |
这里的输入是输出的 20 倍,所以输入单价几乎决定一切。先挑一百份文档作为样本,交给两三个候选模型处理,比较摘要质量,算出总成本后再提交整批任务。
如何降低账单
- 对所有重复内容开启提示词缓存。 把提示词中稳定的部分——指令、工具定义、参考资料——放在前面,把变化的部分放在最后,让前缀在每次请求之间保持完全一致。只要模型有缓存价格,缓存 tokens 就按缓存价格计费。每一步都要重新发送不断增长的上下文的编程智能体和多轮对话,受益最大。
- 限制输出长度。 输出是更贵的方向,所以要设置
max_tokens,并明确要求你需要的格式:一个标签、一个 JSON 对象、三个要点。让模型给出「简短的回答」,它仍会自己决定多短才算短。 - 便宜的模型打草稿,贵的模型收尾。 用低价档位——DeepSeek V4 Flash、GPT 5.6 Luna、Claude Sonnet 5——处理分类、抽取、初稿和路由,只把真正需要的请求交给 Opus、Sol 或 Astra。在 10× 的价差下,即使路由器把十分之一的请求升级,总成本也远低于把所有请求都发给顶级模型的一半。
- 精简重复发送的内容。 用摘要代替回放完整的历史记录,检索更少但更精准的片段。你没发送的每一个 token,无论是否缓存,都不用付钱。
- 用你自己的流量做比较。 测算示例表明,最便宜的模型取决于输入/输出比例以及是否使用缓存。记录一天真实请求的
usage,再按两三个模型分别计算成本。
一个密钥调用所有模型
表中的每个模型都通过一个 API Stock 密钥和一个预付余额调用——这份余额同样用于支付视频、图像和音乐生成。没有订阅,也不需要在每个厂商分别开户:充值之后,每个请求按实际使用的 tokens 扣费。如果某个服务商失败,请求会在备用服务商上重试;在所有服务商上都失败的请求会自动退款。
OpenAI 兼容端点是 POST /api/v1/chat/completions。使用官方 OpenAI SDK 时,把 base URL 指向 API Stock 并使用你的 API Stock 密钥即可;切换模型只需修改 model 字符串。
import OpenAI from "openai";const client = new OpenAI({apiKey: process.env.API_STOCK_KEY,baseURL: "https://api.api-stock.com/api/v1",});const completion = await client.chat.completions.create({model: "deepseek-v4-flash", // 或 "gpt-5.6-luna"、"claude-sonnet-5"、"gemini-3.7-flash"…max_tokens: 300,messages: [{ role: "system", content: "You are a concise support assistant." },{ role: "user", content: "How do I reset my password?" },],});console.log(completion.choices[0].message.content);console.log(completion.usage); // 该请求据以计费的 token 数
Anthropic 兼容端点是 POST /api/v1/messages。它接受 Anthropic 请求格式,其中 max_tokens 为必填项:
curl -X POST https://api.api-stock.com/api/v1/messages \-H "Authorization: Bearer $API_STOCK_KEY" \-H "Content-Type: application/json" \-d '{"model": "claude-sonnet-5","max_tokens": 300,"messages": [{ "role": "user", "content": "How do I reset my password?" }]}'
参数、流式输出和错误处理请参阅 Chat Completions 参考文档 和 Messages 参考文档。上线之前,生产环境检查清单 介绍了密钥管理和余额监控。
常见问题
Gemini API 多少钱?
按目录价格,每个 Gemini Flash 模型都是每百万输入 tokens $0.90。输出方面,Gemini 3.6 和 3.7 Flash 为每百万 $4.50,3.5 Flash 为 $5.40,3.5 Flash (High) 为 $9.72。缓存输入为每百万 $0.09(High 为 $0.162)。实时价格见 Gemini 系列页面。
Claude API 多少钱?
Claude Sonnet 5 为每百万输入 tokens $0.30、每百万输出 tokens $1.50,Claude Fable 5 为 $1.50 / $7.50,Claude Opus 5 为 $3 / $15。三个模型的缓存输入都是输入价格的十分之一。当前价格表见 Claude 系列页面。
DeepSeek 是最便宜的 LLM API 吗?
按每 token 计算,是的:DeepSeek V4 Flash 输入 $0.168、输出 $0.336,是目录中价格最低的模型。但一旦提示词的大部分都可以缓存,GPT 5.6 Luna 和 Claude Sonnet 5 反而可能更便宜,因为 DeepSeek 没有缓存价格——上面的第二个测算示例展示了差距有多大。
如何获取 Claude、Gemini 或 DeepSeek 的 API 密钥?
你不需要为每个厂商分别申请。注册 API Stock,充值任意金额,然后在控制台中创建一个 API 密钥。同一个密钥即可调用 GPT、Claude、Gemini、DeepSeek、Grok、Kimi 以及目录中的所有其他模型。
哪个 LLM API 对我的负载最便宜?
像上面的示例那样,把你每月的输入、输出和缓存 tokens 分别乘以各候选模型的单价。提示词短、回答长,适合输出单价低的模型;长且重复的提示词,适合缓存价格低的模型;一次性的长文档,适合输入单价低的模型。可以从 价格页面 以及 GPT、Claude、Gemini、DeepSeek、Grok 和 Kimi 的系列页面开始。
用你自己的密钥跑一遍
本指南中的所有模型都已上架 API Stock 目录——一个 API 密钥、一个预付余额,无需在各家供应商分别注册。