Chat e LLM
Preços de API de LLM: GPT, Claude, Gemini e DeepSeek comparados
Compare preços de API de LLM de GPT, Claude, Gemini, DeepSeek, Grok e Kimi por 1 milhão de tokens, com custos mensais calculados e formas de reduzir a conta.
"Quanto custa a API do Claude?" não tem uma resposta única, porque ninguém paga por requisição. Uma API de modelo de linguagem cobra por tokens, e cobra em duas ou três tarifas diferentes, dependendo da direção em que eles vão. O mesmo chatbot pode custar $2 por mês em um modelo e $60 em outro, e a ordem entre dois modelos pode se inverter assim que você ativa o cache de prompt.
Este guia coloca lado a lado os preços atuais de todos os modelos de chat do catálogo da API Stock — GPT, Claude, Gemini, DeepSeek, Grok, Kimi e alguns outros — e depois calcula três cargas de trabalho realistas para você ver o que os números por token significam em uma fatura mensal. Ele foi escrito para desenvolvedores que estão escolhendo um modelo para um produto, e para quem já pesquisou "preço da API do Gemini" e encontrou uma tabela sem nenhum exemplo calculado.
O que você realmente paga
Todos os preços abaixo são dados por 1 milhão de tokens, em USD. Um token é um pedaço de palavra; uma página de texto em inglês tem algumas centenas deles. Três tarifas importam:
- Tokens de entrada — tudo o que você envia: o prompt de sistema, o histórico da conversa, os documentos recuperados e a mensagem do usuário. Reenviar o histórico inteiro a cada turno é o motivo pelo qual a entrada costuma dominar uma carga de chat.
- Tokens de saída — tudo o que o modelo devolve. A saída é sempre a direção mais cara: neste catálogo, ela custa de 2 a 6 vezes a tarifa de entrada do mesmo modelo.
- Entrada em cache — a parte do prompt que o provedor já viu e armazenou. Quando um modelo tem tarifa de cache, um token em cache é cobrado por uma pequena fração do preço normal de entrada, geralmente um décimo. Alguns modelos também têm uma tarifa de gravação em cache, cobrada uma única vez quando um prefixo é armazenado pela primeira vez.
Então a conta do mês é simplesmente
entrada × tarifa de entrada + saída × tarifa de saída + cache × tarifa de cache + gravação em cache × tarifa de gravação,
dividido por um milhão. O resto deste guia é essa fórmula aplicada com números
reais.
Preços de API de LLM em resumo
Preços do catálogo conferidos em 24 de setembro de 2026, em USD por 1 milhão de tokens, ordenados pelo preço de entrada. Valores com mais casas decimais no catálogo foram arredondados para o centavo. Cada página de modelo traz a tabela de preços atualizada, e a página de preços lista todos os modelos em um só lugar.
| Modelo | Família | Entrada | Saída | Entrada em cache |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.168 | $0.336 | — |
| GPT 5.6 Luna | GPT | $0.18 | $1.08 | $0.018 |
| Claude Sonnet 5 | Claude | $0.30 | $1.50 | $0.03 |
| Qwen3.7 Plus | Qwen | $0.34 | $1.37 | $0.034 |
| MiniMax M3 | MiniMax | $0.36 | $1.44 | $0.036 |
| DeepSeek V4 Pro | DeepSeek | $0.522 | $1.044 | — |
| GPT 5.6 Terra | GPT | $0.80 | $4.80 | $0.08 |
| Gemini 3.6 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.7 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.5 Flash | Gemini | $0.90 | $5.40 | $0.09 |
| GLM 5.2 | GLM | $0.98 | $3.43 | $0.098 |
| Kimi K2.7 Code | Kimi | $1.11 | $4.62 | $0.111 |
| GPT 5.5 | GPT | $1.50 | $9.00 | $0.15 |
| Claude Fable 5 | Claude | $1.50 | $7.50 | $0.15 |
| Gemini 3.5 Flash (High) | Gemini | $1.62 | $9.72 | $0.162 |
| GLM 5.3 | GLM | $1.68 | $5.28 | $0.312 |
| Grok 4.5 | Grok | $2.10 | $6.30 | $0.525 |
| Grok 4.6 | Grok | $2.10 | $6.30 | $0.525 |
| GPT 5.6 Sol | GPT | $3.00 | $18.00 | $0.30 |
| Claude Opus 5 | Claude | $3.00 | $15.00 | $0.30 |
| Kimi K3 | Kimi | $3.15 | $15.75 | $0.315 |
| GPT 6 Astra | GPT | $8.00 | $40.00 | $0.80 |
Um traço significa que o catálogo não lista tarifa de entrada em cache para aquele modelo, então todo token de entrada é cobrado pelo preço cheio. Estes são os preços da API Stock, independentes dos preços diretos de cada fornecedor.
Qual linha escolher, e quando
Uma tabela de preços ordena os modelos por custo, não por adequação. As notas abaixo se limitam ao que os números dizem sobre cada linha; qual modelo escreve a resposta de que você precisa é algo para testar com os seus próprios prompts.
GPT cobre a faixa mais ampla entre todas as famílias daqui: a entrada no GPT 6 Astra custa mais de quarenta vezes o que custa no GPT 5.6 Luna. O Luna, a $0.18 de entrada e $1.08 de saída, é descrito no catálogo como o nível de alto volume para chat, classificação e etapas leves de agentes. O Terra fica abaixo do GPT 5.5 tanto em entrada quanto em saída, então, para uma integração nova, ele é a opção intermediária mais barata. A saída custa 6× a entrada nos modelos 5.5 e 5.6 e 5× no Astra — mantenha as respostas curtas no GPT e a economia será grande. A entrada em cache custa um décimo da tarifa de entrada em toda a linha.
Claude tem três modelos, e o Claude Sonnet 5 é de longe o mais barato: $0.30 de entrada, $1.50 de saída. O Claude Opus 5 custa exatamente dez vezes mais dos dois lados, o que faz valer a pena montar um roteamento desde o primeiro dia — Sonnet por padrão, Opus para os casos difíceis. O Claude Fable 5, ajustado para textos longos, fica no meio, a $1.50 / $7.50. A saída custa 5× a entrada nos três, as leituras em cache custam um décimo da entrada e uma gravação em cache custa 1.25× a entrada. Sonnet e Opus respondem tanto no endpoint compatível com OpenAI quanto no compatível com Anthropic; o Fable é servido pelo endpoint Messages compatível com Anthropic.
Gemini mantém a entrada fixa: todos os modelos Flash custam $0.90 por milhão de tokens de entrada. A diferença está na saída — o 3.6 Flash e o 3.7 Flash cobram $4.50, o 3.5 Flash, $5.40. A variante High fixa o 3.5 Flash em um orçamento de raciocínio grande e custa 1.8× o 3.5 Flash padrão em todas as tarifas. Se você está escolhendo entre versões do Gemini só pelo preço, o 3.6 e o 3.7 Flash são iguais. A entrada em cache custa um décimo da entrada.
DeepSeek tem os tokens mais baratos do catálogo. O DeepSeek V4 Flash custa $0.168 de entrada e $0.336 de saída, e a saída é só 2× a entrada — a menor diferença entre todos os modelos daqui, então ele continua barato mesmo quando as respostas são longas. O V4 Pro custa cerca de três vezes mais, mas a tarifa de saída de $1.044 ainda fica abaixo da do GPT 5.6 Luna. O porém é o cache: o catálogo não lista tarifa de cache para nenhum dos dois modelos DeepSeek, o que pesa em cargas com prompts extensos (veja o segundo exemplo abaixo).
Grok tem o mesmo preço para o Grok 4.5 e o Grok 4.6, $2.10 / $6.30, então não há motivo de custo para ficar no 4.5. A saída é só 3× a entrada, mas o desconto de cache é menor do que nas outras linhas: um token em cache custa um quarto da tarifa de entrada ($0.525), e não um décimo. Os dois aparecem com contexto de 500K tokens.
Kimi tem um modelo de fronteira e um nível para programação. O Kimi K3 tem preço próximo ao do Claude Opus 5 ($3.15 / $15.75). O Kimi K2.7 Code, feito para edições em escala de repositório, custa cerca de um terço disso e cobra a gravação em cache pela mesma tarifa baixa da leitura ($0.111), então armazenar um contexto grande de repositório não é penalizado.
O restante do catálogo preenche o espaço entre o DeepSeek e a faixa intermediária: Qwen3.7 Plus e MiniMax M3 custam cerca de $0.35 de entrada e $1.40 de saída, enquanto GLM 5.2 e GLM 5.3 custam $0.98–$1.68 de entrada e $3.43–$5.28 de saída.
Exemplos de custo calculados
Três cargas de trabalho, calculadas com as tarifas do catálogo acima. Os totais incluem apenas a cobrança por tokens.
1. Um bot de atendimento ao cliente
5 mil conversas por mês, cada uma enviando cerca de 2 mil tokens de entrada (prompt de sistema, histórico, mensagem do cliente) e recebendo cerca de 400 tokens de resposta. Isso dá 10 milhões de tokens de entrada + 2 milhões de saída.
No Claude Sonnet 5 a conta é 10 × $0.30 + 2 × $1.50 = $3.00 + $3.00.
| Modelo | Entrada | Saída | Mês |
|---|---|---|---|
| DeepSeek V4 Flash | $1.68 | $0.67 | $2.35 |
| GPT 5.6 Luna | $1.80 | $2.16 | $3.96 |
| Claude Sonnet 5 | $3.00 | $3.00 | $6.00 |
| DeepSeek V4 Pro | $5.22 | $2.09 | $7.31 |
| GPT 5.6 Terra | $8.00 | $9.60 | $17.60 |
| Gemini 3.7 Flash | $9.00 | $9.00 | $18.00 |
| Grok 4.6 | $21.00 | $12.60 | $33.60 |
| Claude Opus 5 | $30.00 | $30.00 | $60.00 |
Mesmo com cinco tokens de entrada para cada token de saída, a saída é metade da conta ou mais no GPT, no Claude e no Gemini. O DeepSeek V4 Flash tem a tarifa mais baixa dos dois lados, então lidera com folga.
2. Um assistente com um prompt fixo grande
Um assistente de produto responde a 10 mil perguntas por mês. Toda requisição envia o mesmo bloco de 1.600 tokens — instruções mais um pacote de referência — seguido de cerca de 400 tokens de pergunta e histórico, e recebe uma resposta de 100 tokens. Com o cache de prompt ativado, isso dá 16 milhões em cache + 4 milhões de entrada nova + 1 milhão de saída.
No Claude Sonnet 5: 16 × $0.03 + 4 × $0.30 + 1 × $1.50 = $0.48 + $1.20 + $1.50.
| Modelo | Em cache | Entrada nova | Saída | Com cache | Sem cache |
|---|---|---|---|---|---|
| GPT 5.6 Luna | $0.29 | $0.72 | $1.08 | $2.09 | $4.68 |
| Claude Sonnet 5 | $0.48 | $1.20 | $1.50 | $3.18 | $7.50 |
| DeepSeek V4 Flash | — | $3.36 | $0.34 | $3.70 | $3.70 |
| GPT 5.6 Terra | $1.28 | $3.20 | $4.80 | $9.28 | $20.80 |
| Gemini 3.7 Flash | $1.44 | $3.60 | $4.50 | $9.54 | $22.50 |
| Grok 4.6 | $8.40 | $8.40 | $6.30 | $23.10 | $48.30 |
| Claude Opus 5 | $4.80 | $12.00 | $15.00 | $31.80 | $75.00 |
É aqui que a ordem se inverte. Sem cache, o DeepSeek V4 Flash seria o mais barato; com cache, o GPT 5.6 Luna e o Claude Sonnet 5 ficam abaixo dele, porque o DeepSeek cobra os 20 milhões de tokens de entrada pela tarifa cheia. O cache reduz a conta em 55–58% nos modelos GPT, Claude e Gemini daqui, e em cerca de 52% no Grok, onde os tokens em cache custam um quarto em vez de um décimo. A tabela deixa de fora a cobrança única de gravação em cache nos modelos que a têm; para um prefixo reutilizado milhares de vezes, ela é um erro de arredondamento.
3. Um job de resumo em lote
Você resume 5 mil documentos de cerca de 8 mil tokens cada em um resumo de 400 tokens. Cada documento é diferente, então não há nada para colocar em cache: 40 milhões de entrada + 2 milhões de saída.
| Modelo | Entrada | Saída | Job |
|---|---|---|---|
| DeepSeek V4 Flash | $6.72 | $0.67 | $7.39 |
| GPT 5.6 Luna | $7.20 | $2.16 | $9.36 |
| Claude Sonnet 5 | $12.00 | $3.00 | $15.00 |
| Qwen3.7 Plus | $13.72 | $2.74 | $16.46 |
| MiniMax M3 | $14.40 | $2.88 | $17.28 |
| DeepSeek V4 Pro | $20.88 | $2.09 | $22.97 |
| GPT 5.6 Terra | $32.00 | $9.60 | $41.60 |
| Gemini 3.7 Flash | $36.00 | $9.00 | $45.00 |
Aqui a entrada é 20 vezes a saída, então a tarifa de entrada decide quase tudo. Passe uma amostra de cem documentos por dois ou três candidatos, compare os resumos e faça a conta antes de rodar o lote inteiro.
Como reduzir a conta
- Ative o cache de prompt para tudo o que se repete. Coloque primeiro a parte estável do prompt — instruções, definições de ferramentas, material de referência — e por último a parte que muda, para que o prefixo seja idêntico de uma requisição para a outra. Tokens em cache são cobrados pela tarifa de cache do modelo, sempre que ele tiver uma. Agentes de programação e chats de vários turnos, que reenviam um contexto crescente a cada etapa, são os que mais ganham.
- Limite a saída. A saída é a direção cara, então defina
max_tokense peça o formato de que você precisa: um rótulo, um objeto JSON, três tópicos. Um modelo a quem se pede "uma resposta curta" ainda decide o que é curto. - Rascunho no barato, acabamento no caro. Use um nível de baixo custo — DeepSeek V4 Flash, GPT 5.6 Luna, Claude Sonnet 5 — para classificação, extração, primeiros rascunhos e roteamento, e mande para Opus, Sol ou Astra só as requisições que realmente precisam. Com uma diferença de preço de 10×, um roteador que escala uma requisição em cada dez ainda custa bem menos da metade de mandar tudo para o modelo de topo.
- Enxugue o que você reenvia. Resuma os turnos antigos em vez de repetir o histórico completo, e recupere menos trechos, só que melhores. Cada token que você não envia é um token que você não paga, em cache ou não.
- Compare com o seu próprio tráfego. Os exemplos calculados mostram que o
modelo mais barato depende da proporção entre entrada e saída e do cache.
Registre o
usagede um dia de requisições reais e calcule o custo em dois ou três modelos.
Chamando qualquer um deles com uma só chave
Todos os modelos da tabela funcionam com uma chave da API Stock e um único saldo pré-pago — o mesmo saldo que paga a geração de vídeo, imagem e música. Não há assinatura nem conta por fornecedor: você recarrega o saldo, e cada requisição é cobrada pelos tokens que usou. Se um provedor falhar, a requisição é refeita em um provedor reserva, e uma requisição que falha em todos é reembolsada.
O endpoint compatível com OpenAI é POST /api/v1/chat/completions. Com o SDK
oficial da OpenAI, aponte a base URL para a API Stock e use a sua chave da API
Stock; trocar de modelo é trocar a string model.
import OpenAI from "openai";const client = new OpenAI({apiKey: process.env.API_STOCK_KEY,baseURL: "https://api.api-stock.com/api/v1",});const completion = await client.chat.completions.create({model: "deepseek-v4-flash", // ou "gpt-5.6-luna", "claude-sonnet-5", "gemini-3.7-flash"…max_tokens: 300,messages: [{ role: "system", content: "You are a concise support assistant." },{ role: "user", content: "How do I reset my password?" },],});console.log(completion.choices[0].message.content);console.log(completion.usage); // a contagem de tokens pela qual a requisição é cobrada
O endpoint compatível com Anthropic é POST /api/v1/messages. Ele recebe o
formato de requisição da Anthropic, em que max_tokens é obrigatório:
curl -X POST https://api.api-stock.com/api/v1/messages \-H "Authorization: Bearer $API_STOCK_KEY" \-H "Content-Type: application/json" \-d '{"model": "claude-sonnet-5","max_tokens": 300,"messages": [{ "role": "user", "content": "How do I reset my password?" }]}'
Parâmetros, streaming e tratamento de erros estão na referência de Chat Completions e na referência de Messages. Antes de ir para produção, o checklist de produção cobre o manuseio de chaves e o monitoramento do saldo.
Perguntas frequentes
Quanto custa a API do Gemini?
Pelas tarifas do catálogo, todos os modelos Gemini Flash custam $0.90 por milhão de tokens de entrada. A saída custa $4.50 por milhão no Gemini 3.6 e 3.7 Flash, $5.40 no 3.5 Flash e $9.72 no 3.5 Flash (High). A entrada em cache custa $0.09 por milhão ($0.162 no High). Os preços atualizados estão na página da família Gemini.
Quanto custa a API do Claude?
O Claude Sonnet 5 custa $0.30 por milhão de tokens de entrada e $1.50 por milhão de tokens de saída, o Claude Fable 5, $1.50 / $7.50, e o Claude Opus 5, $3 / $15. A entrada em cache custa um décimo da tarifa de entrada nos três. Veja a tabela atual na página da família Claude.
O DeepSeek é a API de LLM mais barata?
Por token, sim: o DeepSeek V4 Flash, a $0.168 de entrada e $0.336 de saída, é o modelo de menor preço do catálogo. Quando a maior parte do seu prompt pode ir para o cache, o GPT 5.6 Luna e o Claude Sonnet 5 podem sair mais baratos, porque o DeepSeek não tem tarifa de cache — o segundo exemplo calculado acima mostra por quanto.
Como consigo uma chave de API do Claude, do Gemini ou do DeepSeek?
Você não precisa de uma por fornecedor. Crie uma conta na API Stock, recarregue o saldo com qualquer valor e crie uma chave de API no painel. A mesma chave chama GPT, Claude, Gemini, DeepSeek, Grok, Kimi e todos os outros modelos do catálogo.
Qual API de LLM é a mais barata para a minha carga de trabalho?
Multiplique seus tokens mensais de entrada, saída e cache pelas tarifas de cada candidato, como nos exemplos acima. Prompts curtos com respostas longas favorecem uma tarifa de saída baixa; prompts longos e repetidos favorecem uma tarifa de cache barata; documentos longos e únicos favorecem uma tarifa de entrada baixa. Comece pela página de preços e pelas páginas das famílias GPT, Claude, Gemini, DeepSeek, Grok e Kimi.
Rode isto com a sua própria chave
Todos os modelos deste guia estão no catálogo do API Stock — uma chave de API, um saldo pré-pago e nenhum cadastro separado por provedor.