Chat & LLM
LLM-API-Preise: GPT, Claude, Gemini, DeepSeek im Vergleich
LLM-API-Preise für GPT, Claude, Gemini, DeepSeek, Grok und Kimi pro 1M Tokens im Vergleich, mit Monatsrechnungen und Tipps, wie Sie die Kosten senken.
„Was kostet die Claude API?“ lässt sich nicht mit einer Zahl beantworten, denn niemand zahlt pro Anfrage. Eine Sprachmodell-API rechnet Tokens ab, und zwar zu zwei oder drei verschiedenen Tarifen, je nachdem, in welche Richtung sie fließen. Derselbe Chatbot kann auf einem Modell $2 im Monat kosten und auf einem anderen $60 — und die Rangfolge zweier Modelle kann sich umkehren, sobald Sie Prompt-Caching aktivieren.
Dieser Leitfaden stellt die aktuellen Preise aller Chat-Modelle im Katalog von API Stock nebeneinander — GPT, Claude, Gemini, DeepSeek, Grok, Kimi und einige weitere — und rechnet anschließend drei realistische Workloads durch, damit sichtbar wird, was die Preise pro Token für die Monatsrechnung bedeuten. Er richtet sich an Entwicklerinnen und Entwickler, die ein Modell für ein Produkt auswählen, und an alle, die nach „Gemini API Kosten“ gesucht und nur eine Tabelle ohne ein einziges Rechenbeispiel gefunden haben.
Wofür Sie tatsächlich bezahlen
Alle Preise unten gelten pro 1 Million Tokens in USD. Ein Token ist ein Wortteil; eine Seite englischer Fließtext umfasst einige hundert davon. Drei Tarife sind entscheidend:
- Input-Tokens — alles, was Sie senden: den System-Prompt, den Gesprächsverlauf, abgerufene Dokumente und die Nachricht der Nutzerin oder des Nutzers. Weil bei jedem Schritt der gesamte Verlauf erneut gesendet wird, dominiert der Input in einem Chat-Workload meist die Kosten.
- Output-Tokens — alles, was das Modell zurückschreibt. Output ist immer die teurere Richtung: In diesem Katalog kostet er das 2- bis 6-Fache des Input-Tarifs desselben Modells.
- Gecachter Input — der Teil des Prompts, den der Anbieter bereits gesehen und gespeichert hat. Wo ein Modell einen Cache-Tarif hat, wird ein gecachtes Token zu einem kleinen Bruchteil des normalen Input-Preises abgerechnet, meist einem Zehntel. Manche Modelle weisen zusätzlich einen Cache-Write-Tarif aus, der einmalig anfällt, wenn ein Präfix zum ersten Mal gespeichert wird.
Die Monatsrechnung ist also einfach
input × input rate + output × output rate + cached × cache rate + cache writes × cache-write rate, geteilt
durch eine Million. Der Rest dieses Leitfadens wendet genau diese Formel mit
echten Zahlen an.
LLM-API-Preise im Überblick
Katalogpreise mit Stand 24. September 2026, USD pro 1M Tokens, sortiert nach Input-Preis. Werte, die im Katalog mehr Nachkommastellen haben, sind auf den Cent gerundet. Jede Modellseite enthält die aktuelle Preistabelle, und die Preisseite listet alle Modelle an einem Ort auf.
| Modell | Familie | Input | Output | Gecachter Input |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.168 | $0.336 | — |
| GPT 5.6 Luna | GPT | $0.18 | $1.08 | $0.018 |
| Claude Sonnet 5 | Claude | $0.30 | $1.50 | $0.03 |
| Qwen3.7 Plus | Qwen | $0.34 | $1.37 | $0.034 |
| MiniMax M3 | MiniMax | $0.36 | $1.44 | $0.036 |
| DeepSeek V4 Pro | DeepSeek | $0.522 | $1.044 | — |
| GPT 5.6 Terra | GPT | $0.80 | $4.80 | $0.08 |
| Gemini 3.6 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.7 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.5 Flash | Gemini | $0.90 | $5.40 | $0.09 |
| GLM 5.2 | GLM | $0.98 | $3.43 | $0.098 |
| Kimi K2.7 Code | Kimi | $1.11 | $4.62 | $0.111 |
| GPT 5.5 | GPT | $1.50 | $9.00 | $0.15 |
| Claude Fable 5 | Claude | $1.50 | $7.50 | $0.15 |
| Gemini 3.5 Flash (High) | Gemini | $1.62 | $9.72 | $0.162 |
| GLM 5.3 | GLM | $1.68 | $5.28 | $0.312 |
| Grok 4.5 | Grok | $2.10 | $6.30 | $0.525 |
| Grok 4.6 | Grok | $2.10 | $6.30 | $0.525 |
| GPT 5.6 Sol | GPT | $3.00 | $18.00 | $0.30 |
| Claude Opus 5 | Claude | $3.00 | $15.00 | $0.30 |
| Kimi K3 | Kimi | $3.15 | $15.75 | $0.315 |
| GPT 6 Astra | GPT | $8.00 | $40.00 | $0.80 |
Ein Gedankenstrich bedeutet, dass der Katalog für dieses Modell keinen Tarif für gecachten Input ausweist; jedes Input-Token wird dann zum vollen Input-Preis abgerechnet. Es handelt sich um die Preise von API Stock, die von den Direktpreisen der jeweiligen Anbieter unabhängig sind.
Welche Modellreihe, und wann
Eine Preistabelle ordnet Modelle nach Kosten, nicht nach Eignung. Die folgenden Hinweise beschränken sich auf das, was die Zahlen über jede Reihe aussagen; welches Modell die Antwort liefert, die Sie brauchen, sollten Sie mit Ihren eigenen Prompts testen.
GPT deckt die größte Spanne aller Familien hier ab: Input kostet bei GPT 6 Astra mehr als das Vierzigfache von GPT 5.6 Luna. Luna, mit $0.18 Input und $1.08 Output, wird im Katalog als Volumenstufe für Chat, Klassifizierung und leichte Agentenschritte beschrieben. Terra liegt sowohl beim Input als auch beim Output unter GPT 5.5 und ist damit für eine neue Integration die günstigere Mittelklasse-Wahl. Output kostet bei den Modellen 5.5 und 5.6 das 6-Fache des Inputs, bei Astra das 5-Fache — halten Sie die Antworten bei GPT kurz, und die Ersparnis ist groß. Gecachter Input kostet in der ganzen Reihe ein Zehntel des Input-Tarifs.
Claude umfasst drei Modelle, und Claude Sonnet 5 ist mit Abstand das günstigste: $0.30 Input, $1.50 Output. Claude Opus 5 kostet auf beiden Seiten genau das Zehnfache, weshalb sich ein Routing — Sonnet als Standard, Opus für die schwierigen Fälle — vom ersten Tag an lohnt. Claude Fable 5, abgestimmt auf lange Texte, liegt mit $1.50 / $7.50 dazwischen. Output kostet bei allen dreien das 5-Fache des Inputs, gecachte Lesezugriffe ein Zehntel des Inputs, und ein Cache-Write das 1,25-Fache des Inputs. Sonnet und Opus antworten sowohl über den OpenAI-kompatiblen als auch über den Anthropic-kompatiblen Endpunkt; Fable wird über den Anthropic-kompatiblen Messages-Endpunkt bereitgestellt.
Gemini hält den Input konstant: Jedes Flash-Modell kostet $0.90 pro Million Input-Tokens. Der Unterschied liegt im Output — 3.6 Flash und 3.7 Flash berechnen $4.50, 3.5 Flash $5.40. Die High-Variante legt 3.5 Flash auf ein großes Reasoning-Budget fest und kostet bei jedem Tarif das 1,8-Fache des Standard-3.5-Flash. Wenn Sie zwischen Gemini-Versionen allein nach Preis wählen, sind 3.6 und 3.7 Flash gleichwertig. Gecachter Input kostet ein Zehntel des Inputs.
DeepSeek hat die günstigsten Tokens im Katalog. DeepSeek V4 Flash kostet $0.168 Input und $0.336 Output, und der Output ist nur das Doppelte des Inputs — der kleinste Abstand aller Modelle hier, sodass es auch bei langen Antworten günstig bleibt. V4 Pro kostet etwa das Dreifache, doch sein Output-Tarif von $1.044 liegt immer noch unter dem von GPT 5.6 Luna. Der Haken ist das Caching: Der Katalog weist für keines der beiden DeepSeek-Modelle einen Cache-Tarif aus, was bei Prompt-lastigen Workloads ins Gewicht fällt (siehe das zweite Beispiel unten).
Grok bepreist Grok 4.5 und Grok 4.6 identisch mit $2.10 / $6.30, es gibt also keinen Kostengrund, bei 4.5 zu bleiben. Output kostet nur das 3-Fache des Inputs, doch der Cache-Rabatt fällt kleiner aus als anderswo: Ein gecachtes Token kostet ein Viertel des Input-Tarifs ($0.525), nicht ein Zehntel. Beide sind mit einem Kontext von 500K Tokens gelistet.
Kimi bietet ein Frontier-Modell und eine Coding-Stufe. Kimi K3 liegt preislich nahe an Claude Opus 5 ($3.15 / $15.75). Kimi K2.7 Code, gebaut für Änderungen im Umfang ganzer Repositories, kostet etwa ein Drittel davon und berechnet Cache-Writes zum selben niedrigen Tarif wie Cache-Reads ($0.111) — einen großen Repository-Kontext zu speichern, wird also nicht bestraft.
Der Rest des Katalogs füllt die Lücke zwischen DeepSeek und der Mittelklasse: Qwen3.7 Plus und MiniMax M3 kosten rund $0.35 Input und $1.40 Output, GLM 5.2 und GLM 5.3 $0.98–$1.68 Input und $3.43–$5.28 Output.
Kostenbeispiele durchgerechnet
Drei Workloads, berechnet zu den obigen Katalogtarifen. Die Summen umfassen nur die Token-Kosten.
1. Ein Kundenservice-Bot
5.000 Gespräche im Monat, jedes mit etwa 2.000 Input-Tokens (System-Prompt, Verlauf, Nachricht der Kundin oder des Kunden) und etwa 400 Tokens Antwort. Das ergibt 10M Input + 2M Output Tokens.
Bei Claude Sonnet 5 lautet die Rechnung 10 × $0.30 + 2 × $1.50 = $3.00 + $3.00.
| Modell | Input | Output | Monat |
|---|---|---|---|
| DeepSeek V4 Flash | $1.68 | $0.67 | $2.35 |
| GPT 5.6 Luna | $1.80 | $2.16 | $3.96 |
| Claude Sonnet 5 | $3.00 | $3.00 | $6.00 |
| DeepSeek V4 Pro | $5.22 | $2.09 | $7.31 |
| GPT 5.6 Terra | $8.00 | $9.60 | $17.60 |
| Gemini 3.7 Flash | $9.00 | $9.00 | $18.00 |
| Grok 4.6 | $21.00 | $12.60 | $33.60 |
| Claude Opus 5 | $30.00 | $30.00 | $60.00 |
Selbst bei fünf Input-Tokens pro Output-Token macht der Output bei GPT, Claude und Gemini die Hälfte der Rechnung oder mehr aus. DeepSeek V4 Flash hat auf beiden Seiten den niedrigsten Tarif und liegt deshalb klar vorn.
2. Ein Assistent mit großem festem Prompt
Ein Produktassistent beantwortet 10.000 Fragen im Monat. Jede Anfrage sendet denselben Block aus 1.600 Tokens — Anweisungen plus ein Referenzpaket —, gefolgt von etwa 400 Tokens Frage und Verlauf, und erhält eine Antwort von 100 Tokens. Mit aktiviertem Prompt-Caching sind das 16M gecacht + 4M frischer Input + 1M Output.
Bei Claude Sonnet 5: 16 × $0.03 + 4 × $0.30 + 1 × $1.50 = $0.48 + $1.20 + $1.50.
| Modell | Gecacht | Frischer Input | Output | Mit Cache | Ohne Cache |
|---|---|---|---|---|---|
| GPT 5.6 Luna | $0.29 | $0.72 | $1.08 | $2.09 | $4.68 |
| Claude Sonnet 5 | $0.48 | $1.20 | $1.50 | $3.18 | $7.50 |
| DeepSeek V4 Flash | — | $3.36 | $0.34 | $3.70 | $3.70 |
| GPT 5.6 Terra | $1.28 | $3.20 | $4.80 | $9.28 | $20.80 |
| Gemini 3.7 Flash | $1.44 | $3.60 | $4.50 | $9.54 | $22.50 |
| Grok 4.6 | $8.40 | $8.40 | $6.30 | $23.10 | $48.30 |
| Claude Opus 5 | $4.80 | $12.00 | $15.00 | $31.80 | $75.00 |
Hier kehrt sich die Rangfolge um. Ohne Caching wäre DeepSeek V4 Flash am günstigsten; mit Caching unterbieten es sowohl GPT 5.6 Luna als auch Claude Sonnet 5, weil DeepSeek alle 20M Input-Tokens zum vollen Tarif abrechnet. Caching senkt die Rechnung bei den GPT-, Claude- und Gemini-Modellen hier um 55–58 % und bei Grok um etwa 52 %, wo gecachte Tokens ein Viertel statt eines Zehntels kosten. Die Tabelle lässt die einmalige Cache-Write-Gebühr bei Modellen, die eine ausweisen, außer Acht; bei einem Präfix, das tausendfach wiederverwendet wird, fällt sie nicht ins Gewicht.
3. Ein Batch-Job zur Zusammenfassung
Sie fassen 5.000 Dokumente mit je etwa 8.000 Tokens zu einer Kurzfassung von 400 Tokens zusammen. Jedes Dokument ist anders, es gibt also nichts zu cachen: 40M Input + 2M Output.
| Modell | Input | Output | Job |
|---|---|---|---|
| DeepSeek V4 Flash | $6.72 | $0.67 | $7.39 |
| GPT 5.6 Luna | $7.20 | $2.16 | $9.36 |
| Claude Sonnet 5 | $12.00 | $3.00 | $15.00 |
| Qwen3.7 Plus | $13.72 | $2.74 | $16.46 |
| MiniMax M3 | $14.40 | $2.88 | $17.28 |
| DeepSeek V4 Pro | $20.88 | $2.09 | $22.97 |
| GPT 5.6 Terra | $32.00 | $9.60 | $41.60 |
| Gemini 3.7 Flash | $36.00 | $9.00 | $45.00 |
Der Input ist hier 20-mal so groß wie der Output, also entscheidet der Input-Tarif fast alles. Schicken Sie eine Stichprobe von hundert Dokumenten durch zwei oder drei Kandidaten, vergleichen Sie die Zusammenfassungen und rechnen Sie hoch, bevor Sie den gesamten Batch starten.
So senken Sie die Rechnung
- Aktivieren Sie Prompt-Caching für alles, was sich wiederholt. Stellen Sie den stabilen Teil des Prompts — Anweisungen, Tool-Definitionen, Referenzmaterial — an den Anfang und den veränderlichen Teil ans Ende, damit das Präfix von Anfrage zu Anfrage identisch ist. Gecachte Tokens werden überall dort, wo ein Modell einen Cache-Tarif hat, zu diesem Tarif abgerechnet. Am meisten profitieren Coding-Agenten und Chats mit vielen Runden, die bei jedem Schritt einen wachsenden Kontext erneut senden.
- Begrenzen Sie den Output. Output ist die teure Richtung, also setzen
Sie
max_tokensund fordern Sie das benötigte Format an: ein Label, ein JSON-Objekt, drei Aufzählungspunkte. Ein Modell, das um „eine kurze Antwort“ gebeten wird, entscheidet trotzdem selbst, was kurz bedeutet. - Günstig entwerfen, teuer fertigstellen. Nutzen Sie eine günstige Stufe — DeepSeek V4 Flash, GPT 5.6 Luna, Claude Sonnet 5 — für Klassifizierung, Extraktion, erste Entwürfe und Routing, und schicken Sie nur die Anfragen, die es brauchen, an Opus, Sol oder Astra. Bei einem Preisabstand von 10× kostet ein Router, der jede zehnte Anfrage eskaliert, immer noch deutlich weniger als die Hälfte dessen, was es kostet, alles an das Spitzenmodell zu senden.
- Kürzen Sie, was Sie erneut senden. Fassen Sie ältere Gesprächsrunden zusammen, statt den vollständigen Verlauf zu wiederholen, und rufen Sie weniger, dafür bessere Chunks ab. Jedes Token, das Sie nicht senden, müssen Sie auch nicht bezahlen — ob gecacht oder nicht.
- Vergleichen Sie mit Ihrem eigenen Traffic. Die Rechenbeispiele zeigen,
dass das günstigste Modell vom Verhältnis zwischen Input und Output und vom
Caching abhängt. Protokollieren Sie
usageaus einem Tag echter Anfragen und rechnen Sie die Kosten für zwei oder drei Modelle durch.
Alle Modelle mit einem einzigen Schlüssel aufrufen
Jedes Modell in der Tabelle läuft mit einem API Stock-Schlüssel und einem Prepaid-Guthaben — demselben Guthaben, mit dem Sie auch Video-, Bild- und Musikgenerierung bezahlen. Es gibt kein Abo und kein Konto pro Anbieter: Sie laden Guthaben auf, und jede Anfrage wird mit den Tokens abgerechnet, die sie verbraucht hat. Fällt ein Anbieter aus, wird die Anfrage bei einem Reserveanbieter wiederholt, und eine Anfrage, die überall scheitert, wird erstattet.
Der OpenAI-kompatible Endpunkt ist POST /api/v1/chat/completions. Mit dem
offiziellen OpenAI SDK richten Sie die Base-URL auf API Stock und verwenden
Ihren API Stock-Schlüssel; ein Modellwechsel ist eine Änderung des
model-Strings.
import OpenAI from "openai";const client = new OpenAI({apiKey: process.env.API_STOCK_KEY,baseURL: "https://api.api-stock.com/api/v1",});const completion = await client.chat.completions.create({model: "deepseek-v4-flash", // oder "gpt-5.6-luna", "claude-sonnet-5", "gemini-3.7-flash"…max_tokens: 300,messages: [{ role: "system", content: "You are a concise support assistant." },{ role: "user", content: "How do I reset my password?" },],});console.log(completion.choices[0].message.content);console.log(completion.usage); // die Token-Zahlen, nach denen die Anfrage abgerechnet wird
Der Anthropic-kompatible Endpunkt ist POST /api/v1/messages. Er erwartet das
Anthropic-Anfrageformat, in dem max_tokens Pflicht ist:
curl -X POST https://api.api-stock.com/api/v1/messages \-H "Authorization: Bearer $API_STOCK_KEY" \-H "Content-Type: application/json" \-d '{"model": "claude-sonnet-5","max_tokens": 300,"messages": [{ "role": "user", "content": "How do I reset my password?" }]}'
Parameter, Streaming und Fehlerbehandlung finden Sie in der Chat-Completions-Referenz und der Messages-Referenz. Vor dem Livegang behandelt die Produktions-Checkliste den Umgang mit Schlüsseln und die Überwachung des Guthabens.
Häufige Fragen
Was kostet die Gemini API?
Zu Katalogtarifen kostet jedes Gemini-Flash-Modell $0.90 pro Million Input-Tokens. Output kostet $4.50 pro Million bei Gemini 3.6 und 3.7 Flash, $5.40 bei 3.5 Flash und $9.72 bei 3.5 Flash (High). Gecachter Input kostet $0.09 pro Million ($0.162 bei High). Aktuelle Preise finden Sie auf der Gemini-Familienseite.
Was kostet die Claude API?
Claude Sonnet 5 kostet $0.30 pro Million Input-Tokens und $1.50 pro Million Output-Tokens, Claude Fable 5 $1.50 / $7.50 und Claude Opus 5 $3 / $15. Gecachter Input kostet bei allen dreien ein Zehntel des Input-Tarifs. Die aktuelle Tabelle finden Sie auf der Claude-Familienseite.
Ist DeepSeek die günstigste LLM-API?
Pro Token ja: DeepSeek V4 Flash ist mit $0.168 Input und $0.336 Output das günstigste Modell im Katalog. Sobald sich der Großteil Ihres Prompts cachen lässt, können GPT 5.6 Luna und Claude Sonnet 5 günstiger ausfallen, weil DeepSeek keinen Cache-Tarif hat — das zweite Rechenbeispiel oben zeigt, um wie viel.
Wie bekomme ich einen API-Schlüssel für Claude, Gemini oder DeepSeek?
Sie brauchen nicht für jeden Anbieter einen eigenen. Registrieren Sie sich bei API Stock, laden Sie einen beliebigen Betrag auf und erstellen Sie im Dashboard einen API-Schlüssel. Derselbe Schlüssel ruft GPT, Claude, Gemini, DeepSeek, Grok, Kimi und jedes andere Modell im Katalog auf.
Welche LLM-API ist für meinen Workload am günstigsten?
Multiplizieren Sie Ihre monatlichen Input-, Output- und gecachten Tokens mit den Tarifen jedes Kandidaten, wie in den Beispielen oben. Kurze Prompts mit langen Antworten sprechen für einen niedrigen Output-Tarif, lange, wiederholte Prompts für einen günstigen Cache-Tarif, einmalige lange Dokumente für einen niedrigen Input-Tarif. Beginnen Sie mit der Preisseite und den Familienseiten für GPT, Claude, Gemini, DeepSeek, Grok und Kimi.
Mit dem eigenen Schlüssel ausführen
Jedes Modell aus diesem Leitfaden ist im API Stock-Katalog verfügbar — ein API-Schlüssel, ein Prepaid-Guthaben, keine separate Anmeldung pro Anbieter.