Chat et LLM
Tarifs API LLM : GPT, Claude, Gemini, DeepSeek comparés
Tarifs API LLM de GPT, Claude, Gemini, DeepSeek, Grok et Kimi par million de tokens, avec des coûts mensuels chiffrés et des moyens de réduire la facture.
« Combien coûte l'API Claude ? » n'a pas de réponse unique, car personne ne paie à la requête. Une API de modèle de langage facture des tokens, et elle les facture à deux ou trois tarifs différents selon le sens dans lequel ils circulent. Le même chatbot peut coûter $2 par mois sur un modèle et $60 sur un autre, et le classement entre deux modèles peut s'inverser dès que vous activez la mise en cache du prompt.
Ce guide met côte à côte les prix actuels de tous les modèles de chat du catalogue API Stock — GPT, Claude, Gemini, DeepSeek, Grok, Kimi et quelques autres —, puis détaille trois charges de travail réalistes pour montrer ce que les prix par token représentent sur une facture mensuelle. Il s'adresse aux développeurs qui choisissent un modèle pour un produit, et à tous ceux qui ont cherché « prix API Gemini » pour ne trouver qu'un tableau sans le moindre exemple chiffré.
Ce que vous payez réellement
Tous les prix ci-dessous sont indiqués par million de tokens (1M), en USD. Un token est un fragment de mot ; une page de prose anglaise en compte quelques centaines. Trois tarifs comptent :
- Tokens d'entrée — tout ce que vous envoyez : le prompt système, l'historique de la conversation, les documents récupérés et le message de l'utilisateur. C'est parce que l'historique complet est renvoyé à chaque tour que l'entrée domine généralement une charge de chat.
- Tokens de sortie — tout ce que le modèle renvoie. La sortie est toujours le sens le plus cher : dans ce catalogue, elle coûte 2 à 6 fois le tarif d'entrée du même modèle.
- Entrée en cache — la partie du prompt que le fournisseur a déjà vue et stockée. Lorsqu'un modèle a un tarif de cache, un token en cache est facturé une petite fraction du prix d'entrée normal, généralement un dixième. Certains modèles affichent aussi un tarif d'écriture en cache, facturé une seule fois lorsqu'un préfixe est stocké pour la première fois.
La facture d'un mois est donc simplement
input × input rate + output × output rate + cached × cache rate + cache writes × cache-write rate, divisé par
un million. Le reste de ce guide applique cette formule avec des chiffres
réels.
Les prix des API LLM en bref
Prix du catalogue relevés le 24 septembre 2026, en USD par million de tokens, triés par prix d'entrée. Les valeurs qui ont plus de décimales dans le catalogue sont arrondies au cent. Chaque page de modèle affiche la grille tarifaire à jour, et la page des tarifs réunit tous les modèles.
| Modèle | Famille | Entrée | Sortie | Entrée en cache |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.168 | $0.336 | — |
| GPT 5.6 Luna | GPT | $0.18 | $1.08 | $0.018 |
| Claude Sonnet 5 | Claude | $0.30 | $1.50 | $0.03 |
| Qwen3.7 Plus | Qwen | $0.34 | $1.37 | $0.034 |
| MiniMax M3 | MiniMax | $0.36 | $1.44 | $0.036 |
| DeepSeek V4 Pro | DeepSeek | $0.522 | $1.044 | — |
| GPT 5.6 Terra | GPT | $0.80 | $4.80 | $0.08 |
| Gemini 3.6 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.7 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.5 Flash | Gemini | $0.90 | $5.40 | $0.09 |
| GLM 5.2 | GLM | $0.98 | $3.43 | $0.098 |
| Kimi K2.7 Code | Kimi | $1.11 | $4.62 | $0.111 |
| GPT 5.5 | GPT | $1.50 | $9.00 | $0.15 |
| Claude Fable 5 | Claude | $1.50 | $7.50 | $0.15 |
| Gemini 3.5 Flash (High) | Gemini | $1.62 | $9.72 | $0.162 |
| GLM 5.3 | GLM | $1.68 | $5.28 | $0.312 |
| Grok 4.5 | Grok | $2.10 | $6.30 | $0.525 |
| Grok 4.6 | Grok | $2.10 | $6.30 | $0.525 |
| GPT 5.6 Sol | GPT | $3.00 | $18.00 | $0.30 |
| Claude Opus 5 | Claude | $3.00 | $15.00 | $0.30 |
| Kimi K3 | Kimi | $3.15 | $15.75 | $0.315 |
| GPT 6 Astra | GPT | $8.00 | $40.00 | $0.80 |
Un tiret signifie que le catalogue n'indique aucun tarif d'entrée en cache pour ce modèle : chaque token d'entrée est alors facturé au plein tarif. Ce sont les prix d'API Stock, distincts des tarifs pratiqués directement par chaque fournisseur.
Quelle gamme, et quand
Un tableau de prix classe les modèles par coût, pas par adéquation. Les notes ci-dessous s'en tiennent à ce que les chiffres disent de chaque gamme ; quel modèle rédige la réponse dont vous avez besoin, c'est à tester sur vos propres prompts.
GPT couvre l'éventail le plus large de toutes les familles présentées ici : l'entrée sur GPT 6 Astra coûte plus de quarante fois celle de GPT 5.6 Luna. Luna, à $0.18 en entrée et $1.08 en sortie, est décrit dans le catalogue comme le niveau grand volume pour le chat, la classification et les étapes d'agent légères. Terra est moins cher que GPT 5.5 en entrée comme en sortie : pour une nouvelle intégration, c'est donc le choix milieu de gamme le plus économique. La sortie coûte 6× l'entrée sur les modèles 5.5 et 5.6, et 5× sur Astra — gardez des réponses courtes sur GPT et l'économie est importante. L'entrée en cache coûte un dixième du tarif d'entrée sur toute la gamme.
Claude compte trois modèles, et Claude Sonnet 5 est de loin le moins cher : $0.30 en entrée, $1.50 en sortie. Claude Opus 5 coûte exactement dix fois plus des deux côtés, ce qui justifie de mettre en place un routage — Sonnet par défaut, Opus pour les cas difficiles — dès le premier jour. Claude Fable 5, réglé pour l'écriture longue, se situe entre les deux à $1.50 / $7.50. La sortie coûte 5× l'entrée sur les trois, les lectures en cache un dixième de l'entrée, et une écriture en cache 1,25× l'entrée. Sonnet et Opus répondent à la fois sur l'endpoint compatible OpenAI et sur l'endpoint compatible Anthropic ; Fable est servi via l'endpoint Messages compatible Anthropic.
Gemini garde une entrée constante : chaque modèle Flash coûte $0.90 par million de tokens d'entrée. La différence se joue sur la sortie — 3.6 Flash et 3.7 Flash facturent $4.50, 3.5 Flash $5.40. La variante High fixe 3.5 Flash sur un budget de raisonnement élevé et coûte 1,8× le 3.5 Flash standard sur chaque tarif. Si vous choisissez entre les versions de Gemini sur le seul critère du prix, 3.6 et 3.7 Flash se valent. L'entrée en cache coûte un dixième de l'entrée.
DeepSeek a les tokens les moins chers du catalogue. DeepSeek V4 Flash coûte $0.168 en entrée et $0.336 en sortie, et sa sortie ne vaut que 2× son entrée — le plus petit écart de tous les modèles ici, si bien qu'il reste bon marché même quand les réponses s'allongent. V4 Pro coûte environ trois fois plus, mais son tarif de sortie de $1.044 reste inférieur à celui de GPT 5.6 Luna. Le bémol, c'est le cache : le catalogue n'indique aucun tarif de cache pour les deux modèles DeepSeek, ce qui pèse sur les charges riches en prompt (voir le deuxième exemple ci-dessous).
Grok facture Grok 4.5 et Grok 4.6 au même prix, $2.10 / $6.30 : aucune raison de coût de rester sur 4.5. La sortie ne coûte que 3× l'entrée, mais la remise sur le cache est plus faible qu'ailleurs : un token en cache coûte un quart du tarif d'entrée ($0.525), et non un dixième. Les deux sont annoncés avec un contexte de 500K tokens.
Kimi propose un modèle de pointe et un niveau dédié au code. Kimi K3 est tarifé près de Claude Opus 5 ($3.15 / $15.75). Kimi K2.7 Code, conçu pour les modifications à l'échelle d'un dépôt, coûte environ un tiers de ce prix et facture l'écriture en cache au même tarif bas que la lecture ($0.111) : stocker un gros contexte de dépôt n'est donc pas pénalisé.
Le reste du catalogue comble l'écart entre DeepSeek et le milieu de gamme : Qwen3.7 Plus et MiniMax M3 coûtent environ $0.35 en entrée et $1.40 en sortie, tandis que GLM 5.2 et GLM 5.3 coûtent $0.98–$1.68 en entrée et $3.43–$5.28 en sortie.
Exemples de coûts détaillés
Trois charges de travail, calculées aux tarifs du catalogue ci-dessus. Les totaux ne couvrent que les frais de tokens.
1. Un bot de support client
5 000 conversations par mois, chacune envoyant environ 2 000 tokens d'entrée (prompt système, historique, message du client) et recevant environ 400 tokens de réponse. Soit 10M en entrée + 2M en sortie.
Sur Claude Sonnet 5, le calcul donne 10 × $0.30 + 2 × $1.50 = $3.00 + $3.00.
| Modèle | Entrée | Sortie | Mois |
|---|---|---|---|
| DeepSeek V4 Flash | $1.68 | $0.67 | $2.35 |
| GPT 5.6 Luna | $1.80 | $2.16 | $3.96 |
| Claude Sonnet 5 | $3.00 | $3.00 | $6.00 |
| DeepSeek V4 Pro | $5.22 | $2.09 | $7.31 |
| GPT 5.6 Terra | $8.00 | $9.60 | $17.60 |
| Gemini 3.7 Flash | $9.00 | $9.00 | $18.00 |
| Grok 4.6 | $21.00 | $12.60 | $33.60 |
| Claude Opus 5 | $30.00 | $30.00 | $60.00 |
Même avec cinq tokens d'entrée pour un token de sortie, la sortie représente la moitié de la facture ou plus sur GPT, Claude et Gemini. DeepSeek V4 Flash a le tarif le plus bas dans les deux sens, il arrive donc largement en tête.
2. Un assistant avec un gros prompt fixe
Un assistant produit répond à 10 000 questions par mois. Chaque requête envoie le même bloc de 1 600 tokens — instructions et dossier de référence —, suivi d'environ 400 tokens de question et d'historique, et reçoit une réponse de 100 tokens. Avec la mise en cache du prompt activée, cela donne **16M en cache
- 4M d'entrée fraîche + 1M en sortie**.
Sur Claude Sonnet 5 : 16 × $0.03 + 4 × $0.30 + 1 × $1.50 = $0.48 + $1.20 + $1.50.
| Modèle | En cache | Entrée fraîche | Sortie | Avec cache | Sans cache |
|---|---|---|---|---|---|
| GPT 5.6 Luna | $0.29 | $0.72 | $1.08 | $2.09 | $4.68 |
| Claude Sonnet 5 | $0.48 | $1.20 | $1.50 | $3.18 | $7.50 |
| DeepSeek V4 Flash | — | $3.36 | $0.34 | $3.70 | $3.70 |
| GPT 5.6 Terra | $1.28 | $3.20 | $4.80 | $9.28 | $20.80 |
| Gemini 3.7 Flash | $1.44 | $3.60 | $4.50 | $9.54 | $22.50 |
| Grok 4.6 | $8.40 | $8.40 | $6.30 | $23.10 | $48.30 |
| Claude Opus 5 | $4.80 | $12.00 | $15.00 | $31.80 | $75.00 |
C'est ici que le classement s'inverse. Sans cache, DeepSeek V4 Flash serait le moins cher ; avec, GPT 5.6 Luna et Claude Sonnet 5 passent tous deux en dessous, car DeepSeek facture les 20M tokens d'entrée au plein tarif. Le cache réduit la facture de 55–58 % sur les modèles GPT, Claude et Gemini présentés ici, et d'environ 52 % sur Grok, où les tokens en cache coûtent un quart plutôt qu'un dixième. Le tableau laisse de côté les frais ponctuels d'écriture en cache sur les modèles qui en affichent ; pour un préfixe réutilisé des milliers de fois, ils sont négligeables.
3. Une tâche de résumé par lots
Vous résumez 5 000 documents d'environ 8 000 tokens chacun en une synthèse de 400 tokens. Chaque document est différent, il n'y a donc rien à mettre en cache : 40M en entrée + 2M en sortie.
| Modèle | Entrée | Sortie | Tâche |
|---|---|---|---|
| DeepSeek V4 Flash | $6.72 | $0.67 | $7.39 |
| GPT 5.6 Luna | $7.20 | $2.16 | $9.36 |
| Claude Sonnet 5 | $12.00 | $3.00 | $15.00 |
| Qwen3.7 Plus | $13.72 | $2.74 | $16.46 |
| MiniMax M3 | $14.40 | $2.88 | $17.28 |
| DeepSeek V4 Pro | $20.88 | $2.09 | $22.97 |
| GPT 5.6 Terra | $32.00 | $9.60 | $41.60 |
| Gemini 3.7 Flash | $36.00 | $9.00 | $45.00 |
L'entrée pèse ici 20 fois la sortie, c'est donc le tarif d'entrée qui décide presque tout. Faites passer un échantillon d'une centaine de documents par deux ou trois candidats, comparez les résumés et extrapolez avant de lancer le lot complet.
Comment réduire la facture
- Activez la mise en cache du prompt pour tout ce qui se répète. Placez la partie stable du prompt — instructions, définitions d'outils, documentation de référence — en premier et la partie variable en dernier, afin que le préfixe soit identique d'une requête à l'autre. Les tokens en cache sont facturés au tarif de cache du modèle partout où il en a un. Les agents de code et les chats à plusieurs tours, qui renvoient un contexte croissant à chaque étape, sont ceux qui y gagnent le plus.
- Plafonnez la sortie. La sortie est le sens le plus cher : définissez
max_tokenset demandez le format dont vous avez besoin — un libellé, un objet JSON, trois puces. Un modèle à qui l'on demande « une réponse courte » décide quand même de ce que « courte » veut dire. - Ébauchez à bas prix, finalisez au prix fort. Utilisez un niveau économique — DeepSeek V4 Flash, GPT 5.6 Luna, Claude Sonnet 5 — pour la classification, l'extraction, les premiers jets et le routage, et n'envoyez à Opus, Sol ou Astra que les requêtes qui le nécessitent. Avec un écart de prix de 10×, un routeur qui fait remonter une requête sur dix coûte encore bien moins de la moitié de ce que coûterait tout envoyer au modèle haut de gamme.
- Allégez ce que vous renvoyez. Résumez les anciens tours au lieu de rejouer l'historique complet, et récupérez moins de fragments, mais de meilleure qualité. Chaque token que vous n'envoyez pas est un token que vous ne payez pas, en cache ou non.
- Comparez sur votre propre trafic. Les exemples chiffrés montrent que le
modèle le moins cher dépend du rapport entrée/sortie et du cache.
Enregistrez
usagesur une journée de requêtes réelles et calculez-en le coût sur deux ou trois modèles.
Appeler tous ces modèles avec une seule clé
Chaque modèle du tableau fonctionne avec une seule clé API Stock et un seul solde prépayé — le même solde qui paie la génération de vidéos, d'images et de musique. Pas d'abonnement ni de compte par fournisseur : vous rechargez votre solde, et chaque requête est facturée selon les tokens qu'elle a consommés. Si un fournisseur échoue, la requête est relancée sur un fournisseur de réserve, et une requête qui échoue partout est remboursée.
L'endpoint compatible OpenAI est POST /api/v1/chat/completions. Avec le SDK
officiel d'OpenAI, faites pointer la base URL vers API Stock et utilisez votre
clé API Stock ; changer de modèle revient à changer la chaîne model.
import OpenAI from "openai";const client = new OpenAI({apiKey: process.env.API_STOCK_KEY,baseURL: "https://api.api-stock.com/api/v1",});const completion = await client.chat.completions.create({model: "deepseek-v4-flash", // ou "gpt-5.6-luna", "claude-sonnet-5", "gemini-3.7-flash"…max_tokens: 300,messages: [{ role: "system", content: "You are a concise support assistant." },{ role: "user", content: "How do I reset my password?" },],});console.log(completion.choices[0].message.content);console.log(completion.usage); // le nombre de tokens sur lequel la requête est facturée
L'endpoint compatible Anthropic est POST /api/v1/messages. Il accepte le
format de requête d'Anthropic, dans lequel max_tokens est obligatoire :
curl -X POST https://api.api-stock.com/api/v1/messages \-H "Authorization: Bearer $API_STOCK_KEY" \-H "Content-Type: application/json" \-d '{"model": "claude-sonnet-5","max_tokens": 300,"messages": [{ "role": "user", "content": "How do I reset my password?" }]}'
Les paramètres, le streaming et la gestion des erreurs sont décrits dans la référence Chat Completions et la référence Messages. Avant la mise en production, la checklist de production couvre la gestion des clés et la surveillance du solde.
Questions fréquentes
Combien coûte l'API Gemini ?
Aux tarifs du catalogue, chaque modèle Gemini Flash coûte $0.90 par million de tokens d'entrée. La sortie coûte $4.50 par million sur Gemini 3.6 et 3.7 Flash, $5.40 sur 3.5 Flash et $9.72 sur 3.5 Flash (High). L'entrée en cache coûte $0.09 par million ($0.162 sur High). Les prix à jour figurent sur la page de la famille Gemini.
Combien coûte l'API Claude ?
Claude Sonnet 5 coûte $0.30 par million de tokens d'entrée et $1.50 par million de tokens de sortie, Claude Fable 5 $1.50 / $7.50 et Claude Opus 5 $3 / $15. L'entrée en cache coûte un dixième du tarif d'entrée sur les trois. Consultez la page de la famille Claude pour la grille actuelle.
DeepSeek est-elle l'API LLM la moins chère ?
Au token, oui : DeepSeek V4 Flash, à $0.168 en entrée et $0.336 en sortie, est le modèle le moins cher du catalogue. Dès que la majeure partie de votre prompt peut être mise en cache, GPT 5.6 Luna et Claude Sonnet 5 peuvent revenir moins cher, car DeepSeek n'a pas de tarif de cache — le deuxième exemple chiffré ci-dessus montre de combien.
Comment obtenir une clé API Claude, Gemini ou DeepSeek ?
Vous n'avez pas besoin d'une clé par fournisseur. Inscrivez-vous sur API Stock, rechargez votre solde du montant de votre choix et créez une clé API dans le tableau de bord. La même clé appelle GPT, Claude, Gemini, DeepSeek, Grok, Kimi et tous les autres modèles du catalogue.
Quelle API LLM est la moins chère pour ma charge de travail ?
Multipliez vos tokens mensuels d'entrée, de sortie et en cache par les tarifs de chaque candidat, comme dans les exemples ci-dessus. Des prompts courts avec de longues réponses favorisent un tarif de sortie bas ; de longs prompts répétés, un tarif de cache bon marché ; des documents longs et uniques, un tarif d'entrée bas. Partez de la page des tarifs et des pages de famille GPT, Claude, Gemini, DeepSeek, Grok et Kimi.
Essayez avec votre propre clé
Tous les modèles de ce guide sont disponibles dans le catalogue API Stock — une clé d’API, un solde prépayé, aucune inscription séparée par fournisseur.