チャットと LLM
LLM API 料金比較:GPT・Claude・Gemini・DeepSeek
GPT、Claude、Gemini、DeepSeek、Grok、Kimi の LLM API 料金を 1M トークンあたりで比較し、月額コストの試算例と請求額を抑える実践的な方法を紹介します。
「Claude API の料金はいくら?」という問いに、ひとつの答えはありません。リクエスト単位で支払う人はいないからです。言語モデルの API はトークンに課金し、しかもトークンの向きによって 2〜3 種類の異なる単価で課金します。同じチャットボットでも、あるモデルでは月 $2、別のモデルでは $60 かかることがあり、プロンプトキャッシュを有効にした途端に 2 つのモデルの順位が逆転することもあります。
このガイドでは、API Stock カタログにあるすべてのチャットモデル(GPT、Claude、Gemini、DeepSeek、Grok、Kimi ほか数モデル)の現在の料金を並べて比較し、そのうえで現実的な 3 つのワークロードを試算して、トークン単価が月々の請求額にどう響くかを示します。プロダクトに組み込むモデルを選ぶ開発者、そして「Gemini API 料金」で検索して、試算例がひとつもない料金表しか見つからなかった方に向けた内容です。
実際に何に料金を払っているのか
以下の料金はすべて 1M(100 万)トークンあたり の米ドル表記です。トークンは単語の一部分にあたり、英文 1 ページはおよそ数百トークンです。重要な単価は次の 3 つです。
- 入力トークン:送信するすべて。システムプロンプト、会話履歴、検索で取得したドキュメント、ユーザーのメッセージが含まれます。ターンごとに履歴全体を送り直すため、チャット系のワークロードでは通常、入力が大半を占めます。
- 出力トークン:モデルが返すすべて。出力は常に高いほうの向きで、このカタログでは同じモデルの入力単価の 2〜6 倍 です。
- キャッシュ入力:プロバイダーがすでに受け取って保存済みのプロンプト部分です。キャッシュ単価があるモデルでは、キャッシュされたトークンは通常の入力料金のごく一部、たいていは 10 分の 1 で課金されます。一部のモデルには キャッシュ書き込み の単価も設定されており、プレフィックスを最初に保存するときに 1 回だけ課金されます。
つまり 1 か月の請求額は、単純に input × input rate + output × output rate + cached × cache rate + cache writes × cache-write rate を 100 万で割ったものです。このガイドの残りは、この式に実際の数字を当てはめていく作業です。
LLM API 料金一覧
カタログ料金は 2026 年 9 月 24 日 時点で確認したもので、1M トークンあたりの米ドル、入力料金の安い順に並べています。カタログ上で小数点以下の桁が多い数値はセント単位に丸めています。各モデルページにはリアルタイムの料金表があり、料金ページ ではすべてのモデルを一覧できます。
| モデル | ファミリー | 入力 | 出力 | キャッシュ入力 |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.168 | $0.336 | — |
| GPT 5.6 Luna | GPT | $0.18 | $1.08 | $0.018 |
| Claude Sonnet 5 | Claude | $0.30 | $1.50 | $0.03 |
| Qwen3.7 Plus | Qwen | $0.34 | $1.37 | $0.034 |
| MiniMax M3 | MiniMax | $0.36 | $1.44 | $0.036 |
| DeepSeek V4 Pro | DeepSeek | $0.522 | $1.044 | — |
| GPT 5.6 Terra | GPT | $0.80 | $4.80 | $0.08 |
| Gemini 3.6 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.7 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.5 Flash | Gemini | $0.90 | $5.40 | $0.09 |
| GLM 5.2 | GLM | $0.98 | $3.43 | $0.098 |
| Kimi K2.7 Code | Kimi | $1.11 | $4.62 | $0.111 |
| GPT 5.5 | GPT | $1.50 | $9.00 | $0.15 |
| Claude Fable 5 | Claude | $1.50 | $7.50 | $0.15 |
| Gemini 3.5 Flash (High) | Gemini | $1.62 | $9.72 | $0.162 |
| GLM 5.3 | GLM | $1.68 | $5.28 | $0.312 |
| Grok 4.5 | Grok | $2.10 | $6.30 | $0.525 |
| Grok 4.6 | Grok | $2.10 | $6.30 | $0.525 |
| GPT 5.6 Sol | GPT | $3.00 | $18.00 | $0.30 |
| Claude Opus 5 | Claude | $3.00 | $15.00 | $0.30 |
| Kimi K3 | Kimi | $3.15 | $15.75 | $0.315 |
| GPT 6 Astra | GPT | $8.00 | $40.00 | $0.80 |
ダッシュは、カタログにそのモデルのキャッシュ入力単価が記載されていないことを意味し、入力トークンはすべて通常の入力料金で課金されます。これらは API Stock の料金であり、各ベンダーが直接提供する料金とは別のものです。
どのシリーズを、いつ選ぶか
料金表はモデルをコストで並べるものであり、適性で並べるものではありません。以下では数字から言えることだけを述べます。必要な回答を書けるのがどのモデルかは、ご自身のプロンプトで試して確かめてください。
GPT は、ここにあるファミリーの中で最も価格帯が広いシリーズです。GPT 6 Astra の入力料金は GPT 5.6 Luna の 40 倍以上です。Luna は入力 $0.18、出力 $1.08 で、カタログではチャット、分類、軽量なエージェント処理向けの大量処理ティアと位置づけられています。Terra は入力・出力ともに GPT 5.5 より安いため、新規の組み込みでは割安な中位クラスの選択肢になります。出力は 5.5 と 5.6 のモデルで入力の 6×、Astra で 5× です。GPT では回答を短く保つだけで大きな節約になります。キャッシュ入力はシリーズ全体で入力単価の 10 分の 1 です。
Claude には 3 つのモデルがあり、Claude Sonnet 5 が群を抜いて安価です(入力 $0.30、出力 $1.50)。Claude Opus 5 は入力・出力ともにちょうど 10 倍の料金なので、「基本は Sonnet、難しいケースだけ Opus」というルーティングは初日から組む価値があります。長文執筆向けに調整された Claude Fable 5 はその中間で、$1.50 / $7.50 です。3 モデルとも出力は入力の 5×、キャッシュ読み取りは入力の 10 分の 1、キャッシュ書き込みは入力の 1.25× です。Sonnet と Opus は OpenAI 互換と Anthropic 互換の両方のエンドポイントで利用でき、Fable は Anthropic 互換の Messages エンドポイントで提供されます。
Gemini は入力料金が一律で、どの Flash モデルも入力 100 万トークンあたり $0.90 です。違いは出力にあり、3.6 Flash と 3.7 Flash は $4.50、3.5 Flash は $5.40 です。High バリアント は 3.5 Flash を大きな推論バジェットに固定したもので、すべての単価が標準の 3.5 Flash の 1.8× です。料金だけで Gemini のバージョンを選ぶなら、3.6 Flash と 3.7 Flash は同じです。キャッシュ入力は入力の 10 分の 1 です。
DeepSeek はカタログで最も安いトークンを提供しています。DeepSeek V4 Flash は入力 $0.168、出力 $0.336 で、出力は入力のわずか 2× です。これはここにあるどのモデルよりも小さい差で、回答が長くなっても安いままです。V4 Pro は約 3 倍の料金ですが、出力単価 $1.044 は GPT 5.6 Luna よりも低い水準です。注意点はキャッシュで、カタログにはどちらの DeepSeek モデルにもキャッシュ単価が記載されていません。プロンプトの比重が大きいワークロードではこれが効いてきます(後述の 2 つ目の例を参照)。
Grok は Grok 4.5 と Grok 4.6 を同じ $2.10 / $6.30 で提供しているため、コスト面で 4.5 にとどまる理由はありません。出力は入力の 3× にとどまりますが、キャッシュ割引は他より小さく、キャッシュされたトークンは入力単価の 10 分の 1 ではなく 4 分の 1($0.525)です。どちらも 500K トークンのコンテキストと記載されています。
Kimi にはフロンティアモデルとコーディング用ティアがあります。Kimi K3 の料金は Claude Opus 5 に近い水準です($3.15 / $15.75)。リポジトリ規模の編集向けに作られた Kimi K2.7 Code はその約 3 分の 1 で、キャッシュ書き込みもキャッシュ読み取りと同じ低い単価($0.111)で課金されるため、大きなリポジトリのコンテキストを保存してもペナルティがありません。
カタログのその他のモデルは、DeepSeek と中位クラスの間を埋めています。Qwen3.7 Plus と MiniMax M3 は入力約 $0.35、出力約 $1.40、GLM 5.2 と GLM 5.3 は入力 $0.98–$1.68、出力 $3.43–$5.28 です。
コスト試算の例
3 つのワークロードを、上記のカタログ料金で試算します。合計はトークン料金のみです。
1. カスタマーサポートボット
月 5,000 件の会話で、1 件あたり約 2,000 入力トークン(システムプロンプト、履歴、顧客のメッセージ)を送り、約 400 トークンの回答を受け取ります。合計10M 入力 + 2M 出力 トークンです。
Claude Sonnet 5 での計算は 10 × $0.30 + 2 × $1.50 = $3.00 + $3.00 です。
| モデル | 入力 | 出力 | 月額 |
|---|---|---|---|
| DeepSeek V4 Flash | $1.68 | $0.67 | $2.35 |
| GPT 5.6 Luna | $1.80 | $2.16 | $3.96 |
| Claude Sonnet 5 | $3.00 | $3.00 | $6.00 |
| DeepSeek V4 Pro | $5.22 | $2.09 | $7.31 |
| GPT 5.6 Terra | $8.00 | $9.60 | $17.60 |
| Gemini 3.7 Flash | $9.00 | $9.00 | $18.00 |
| Grok 4.6 | $21.00 | $12.60 | $33.60 |
| Claude Opus 5 | $30.00 | $30.00 | $60.00 |
出力 1 トークンに対して入力が 5 トークンあっても、GPT、Claude、Gemini では出力が請求額の半分以上を占めます。DeepSeek V4 Flash は入出力ともに最安の単価なので、余裕を持ってトップに立ちます。
2. 大きな固定プロンプトを持つアシスタント
あるプロダクトアシスタントは月に 10,000 件の質問に答えます。どのリクエストでも同じ 1,600 トークンのブロック(指示と参考資料一式)を送り、その後に約 400 トークンの質問と履歴が続き、100 トークンの回答を受け取ります。プロンプトキャッシュを有効にすると、16M キャッシュ + 4M 新規入力 + 1M 出力 になります。
Claude Sonnet 5 では 16 × $0.03 + 4 × $0.30 + 1 × $1.50 = $0.48 + $1.20 + $1.50 です。
| モデル | キャッシュ | 新規入力 | 出力 | キャッシュあり | キャッシュなし |
|---|---|---|---|---|---|
| GPT 5.6 Luna | $0.29 | $0.72 | $1.08 | $2.09 | $4.68 |
| Claude Sonnet 5 | $0.48 | $1.20 | $1.50 | $3.18 | $7.50 |
| DeepSeek V4 Flash | — | $3.36 | $0.34 | $3.70 | $3.70 |
| GPT 5.6 Terra | $1.28 | $3.20 | $4.80 | $9.28 | $20.80 |
| Gemini 3.7 Flash | $1.44 | $3.60 | $4.50 | $9.54 | $22.50 |
| Grok 4.6 | $8.40 | $8.40 | $6.30 | $23.10 | $48.30 |
| Claude Opus 5 | $4.80 | $12.00 | $15.00 | $31.80 | $75.00 |
ここで順位が逆転します。キャッシュなしなら DeepSeek V4 Flash が最安ですが、キャッシュを使うと GPT 5.6 Luna と Claude Sonnet 5 がどちらもそれを下回ります。DeepSeek は 20M の入力トークンすべてを通常料金で課金するためです。キャッシュによって、ここにある GPT、Claude、Gemini のモデルでは請求額が 55–58% 下がり、キャッシュトークンが 10 分の 1 ではなく 4 分の 1 の Grok では約 52% 下がります。表には、キャッシュ書き込み単価があるモデルで 1 回だけかかる書き込み料金を含めていませんが、数千回再利用するプレフィックスであれば誤差の範囲です。
3. バッチでの要約ジョブ
約 8,000 トークンのドキュメント 5,000 件を、それぞれ 400 トークンの要約にまとめます。ドキュメントはすべて異なるため、キャッシュできるものはありません。40M 入力 + 2M 出力 です。
| モデル | 入力 | 出力 | ジョブ |
|---|---|---|---|
| DeepSeek V4 Flash | $6.72 | $0.67 | $7.39 |
| GPT 5.6 Luna | $7.20 | $2.16 | $9.36 |
| Claude Sonnet 5 | $12.00 | $3.00 | $15.00 |
| Qwen3.7 Plus | $13.72 | $2.74 | $16.46 |
| MiniMax M3 | $14.40 | $2.88 | $17.28 |
| DeepSeek V4 Pro | $20.88 | $2.09 | $22.97 |
| GPT 5.6 Terra | $32.00 | $9.60 | $41.60 |
| Gemini 3.7 Flash | $36.00 | $9.00 | $45.00 |
ここでは入力が出力の 20 倍なので、ほぼすべてが入力単価で決まります。まず 100 件ほどのサンプルを 2〜3 の候補モデルで処理して要約を比べ、総額を掛け算で見積もってからバッチ全体を投入しましょう。
請求額を抑える方法
- 繰り返し送る内容にはプロンプトキャッシュを使う。 指示、ツール定義、参考資料などプロンプトの不変部分を先頭に、変化する部分を末尾に置き、リクエスト間でプレフィックスが完全に同一になるようにします。キャッシュ単価があるモデルなら、キャッシュされたトークンはその単価で課金されます。ステップごとに増え続けるコンテキストを送り直すコーディングエージェントやマルチターンのチャットが、最も大きな恩恵を受けます。
- 出力に上限を設ける。 出力は高いほうの向きなので、
max_tokensを設定し、ラベル、JSON オブジェクト、箇条書き 3 点など、必要な形式を指定しましょう。「短い回答」を求めても、何をもって短いとするかはモデルが決めてしまいます。 - 下書きは安く、仕上げは高く。 分類、抽出、初稿、ルーティングには DeepSeek V4 Flash、GPT 5.6 Luna、Claude Sonnet 5 といった低価格ティアを使い、必要なリクエストだけを Opus、Sol、Astra に送ります。10× の価格差があれば、10 件に 1 件を上位モデルに回すルーターでも、すべてを最上位モデルに送る場合の半分を大きく下回るコストで済みます。
- 送り直す内容を削る。 履歴全体を再送する代わりに古いターンを要約し、取得するチャンクは少なく、質の高いものに絞ります。送らなかったトークンには、キャッシュの有無にかかわらず料金はかかりません。
- 自分のトラフィックで比較する。 試算例が示すとおり、最も安いモデルは入出力の比率とキャッシュの有無によって変わります。1 日分の実際のリクエストの
usageを記録し、2〜3 のモデルでコストを計算してみてください。
1 つのキーですべてのモデルを呼び出す
表にあるすべてのモデルは、1 つの API Stock キーと 1 つのプリペイド残高で利用できます。この残高は動画・画像・音楽の生成にも使えます。サブスクリプションもベンダーごとのアカウントも不要で、チャージした残高から、各リクエストで使ったトークン分が差し引かれます。プロバイダーが失敗した場合は予備のプロバイダーでリクエストを再試行し、すべてで失敗したリクエストは返金されます。
OpenAI 互換エンドポイントは POST /api/v1/chat/completions です。公式の OpenAI SDK を使う場合は、ベース URL を API Stock に向け、API Stock のキーを使うだけです。モデルの切り替えは model の文字列を変えるだけで済みます。
import OpenAI from "openai";const client = new OpenAI({apiKey: process.env.API_STOCK_KEY,baseURL: "https://api.api-stock.com/api/v1",});const completion = await client.chat.completions.create({model: "deepseek-v4-flash", // または "gpt-5.6-luna"、"claude-sonnet-5"、"gemini-3.7-flash"…max_tokens: 300,messages: [{ role: "system", content: "You are a concise support assistant." },{ role: "user", content: "How do I reset my password?" },],});console.log(completion.choices[0].message.content);console.log(completion.usage); // このリクエストの課金対象となるトークン数
Anthropic 互換エンドポイントは POST /api/v1/messages です。Anthropic のリクエスト形式を受け付け、max_tokens は必須です。
curl -X POST https://api.api-stock.com/api/v1/messages \-H "Authorization: Bearer $API_STOCK_KEY" \-H "Content-Type: application/json" \-d '{"model": "claude-sonnet-5","max_tokens": 300,"messages": [{ "role": "user", "content": "How do I reset my password?" }]}'
パラメーター、ストリーミング、エラー処理については Chat Completions リファレンス と Messages リファレンス をご覧ください。本番公開の前には、本番運用チェックリスト でキーの管理と残高の監視を確認しておきましょう。
よくある質問
Gemini API の料金はいくらですか?
カタログ料金では、どの Gemini Flash モデルも入力 100 万トークンあたり $0.90 です。出力は 100 万トークンあたり、Gemini 3.6 Flash と 3.7 Flash が $4.50、3.5 Flash が $5.40、3.5 Flash (High) が $9.72 です。キャッシュ入力は 100 万トークンあたり $0.09(High は $0.162)です。リアルタイムの料金は Gemini ファミリーページ に掲載しています。
Claude API の料金はいくらですか?
Claude Sonnet 5 は入力 100 万トークンあたり $0.30、出力 100 万トークンあたり $1.50、Claude Fable 5 は $1.50 / $7.50、Claude Opus 5 は $3 / $15 です。キャッシュ入力は 3 モデルとも入力単価の 10 分の 1 です。最新の料金表は Claude ファミリーページ をご覧ください。
DeepSeek は最も安い LLM API ですか?
トークン単価で見れば、そのとおりです。DeepSeek V4 Flash は入力 $0.168、出力 $0.336 で、カタログで最も安いモデルです。ただしプロンプトの大部分をキャッシュできる場合は、DeepSeek にキャッシュ単価がないため、GPT 5.6 Luna や Claude Sonnet 5 のほうが安くなることがあります。どれだけ差が出るかは、上の 2 つ目の試算例のとおりです。
Claude、Gemini、DeepSeek の API キーはどうやって入手しますか?
ベンダーごとにキーを用意する必要はありません。API Stock に登録し、任意の金額をチャージして、ダッシュボードで API キーを作成してください。同じキーで GPT、Claude、Gemini、DeepSeek、Grok、Kimi をはじめ、カタログ内のすべてのモデルを呼び出せます。
自分のワークロードで最も安い LLM API はどれですか?
上の例と同じように、月間の入力・出力・キャッシュのトークン数に各候補の単価を掛けてください。プロンプトが短く回答が長いなら出力単価の低いモデル、長いプロンプトを繰り返し送るならキャッシュ単価の安いモデル、一度きりの長いドキュメントなら入力単価の低いモデルが有利です。まずは 料金ページ と、GPT、Claude、Gemini、DeepSeek、Grok、Kimi の各ファミリーページから始めましょう。
自分の API キーで試す
このガイドで扱うモデルはすべて API Stock のカタログで利用できます。API キーは 1 つ、プリペイド残高も 1 つで、プロバイダーごとの登録は不要です。