Chat & LLM
Harga API LLM: GPT, Claude, Gemini, DeepSeek dibandingkan
Bandingkan harga API LLM GPT, Claude, Gemini, DeepSeek, Grok, dan Kimi per 1 juta token, lengkap dengan contoh biaya bulanan dan cara menekan tagihan.
"Berapa biaya API Claude?" tidak punya satu jawaban, karena tidak ada yang membayar per permintaan. API model bahasa menagih token, dan menagihnya dengan dua atau tiga tarif berbeda tergantung arah perjalanannya. Chatbot yang sama bisa menghabiskan $2 sebulan di satu model dan $60 di model lain, dan urutan dua model bisa berbalik begitu Anda menyalakan prompt caching.
Panduan ini menyandingkan harga terkini semua model chat di katalog API Stock — GPT, Claude, Gemini, DeepSeek, Grok, Kimi, dan beberapa lainnya — lalu menghitung tiga beban kerja yang realistis agar Anda bisa melihat arti angka per token itu pada tagihan bulanan. Panduan ini ditulis untuk developer yang sedang memilih model untuk produk, dan untuk siapa pun yang pernah mencari "harga API Gemini" lalu hanya menemukan tabel tanpa satu pun contoh perhitungan.
Apa yang sebenarnya Anda bayar
Semua harga di bawah dinyatakan per 1 juta token, dalam USD. Token adalah potongan kata; satu halaman teks berbahasa Inggris berisi beberapa ratus token. Ada tiga tarif yang penting:
- Token input — semua yang Anda kirim: system prompt, riwayat percakapan, dokumen yang diambil, dan pesan pengguna. Mengirim ulang seluruh riwayat di setiap giliran adalah alasan input biasanya mendominasi beban kerja chat.
- Token output — semua yang ditulis balik oleh model. Output selalu arah yang lebih mahal: di katalog ini harganya 2 hingga 6 kali tarif input model yang sama.
- Input yang di-cache — bagian prompt yang sudah pernah dilihat dan disimpan oleh penyedia. Jika sebuah model punya tarif cache, token yang di-cache ditagih sebagian kecil dari harga input normal, biasanya sepersepuluh. Beberapa model juga mencantumkan tarif penulisan cache, yang ditagih sekali saat sebuah prefiks pertama kali disimpan.
Jadi tagihan sebulan cukup dihitung dengan
input × tarif input + output × tarif output + cache × tarif cache + tulis cache × tarif tulis cache, lalu
dibagi satu juta. Sisa panduan ini adalah rumus tersebut yang diterapkan
dengan angka nyata.
Sekilas harga API LLM
Harga katalog diperiksa pada 24 September 2026, dalam USD per 1 juta token, diurutkan berdasarkan harga input. Angka yang di katalog memiliki lebih banyak desimal dibulatkan ke sen. Setiap halaman model menampilkan tabel harga terkini, dan halaman harga mencantumkan semua model di satu tempat.
| Model | Keluarga | Input | Output | Input di-cache |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.168 | $0.336 | — |
| GPT 5.6 Luna | GPT | $0.18 | $1.08 | $0.018 |
| Claude Sonnet 5 | Claude | $0.30 | $1.50 | $0.03 |
| Qwen3.7 Plus | Qwen | $0.34 | $1.37 | $0.034 |
| MiniMax M3 | MiniMax | $0.36 | $1.44 | $0.036 |
| DeepSeek V4 Pro | DeepSeek | $0.522 | $1.044 | — |
| GPT 5.6 Terra | GPT | $0.80 | $4.80 | $0.08 |
| Gemini 3.6 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.7 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.5 Flash | Gemini | $0.90 | $5.40 | $0.09 |
| GLM 5.2 | GLM | $0.98 | $3.43 | $0.098 |
| Kimi K2.7 Code | Kimi | $1.11 | $4.62 | $0.111 |
| GPT 5.5 | GPT | $1.50 | $9.00 | $0.15 |
| Claude Fable 5 | Claude | $1.50 | $7.50 | $0.15 |
| Gemini 3.5 Flash (High) | Gemini | $1.62 | $9.72 | $0.162 |
| GLM 5.3 | GLM | $1.68 | $5.28 | $0.312 |
| Grok 4.5 | Grok | $2.10 | $6.30 | $0.525 |
| Grok 4.6 | Grok | $2.10 | $6.30 | $0.525 |
| GPT 5.6 Sol | GPT | $3.00 | $18.00 | $0.30 |
| Claude Opus 5 | Claude | $3.00 | $15.00 | $0.30 |
| Kimi K3 | Kimi | $3.15 | $15.75 | $0.315 |
| GPT 6 Astra | GPT | $8.00 | $40.00 | $0.80 |
Tanda pisah berarti katalog tidak mencantumkan tarif input yang di-cache untuk model tersebut, sehingga setiap token input ditagih dengan harga input penuh. Ini adalah harga API Stock, terpisah dari harga langsung masing-masing vendor.
Lini mana, dan kapan
Tabel harga mengurutkan model berdasarkan biaya, bukan kecocokan. Catatan di bawah hanya membahas apa yang ditunjukkan angka tentang setiap lini; model mana yang menulis jawaban yang Anda butuhkan perlu diuji dengan prompt Anda sendiri.
GPT memiliki rentang terlebar di antara semua keluarga di sini: input di GPT 6 Astra lebih dari empat puluh kali lipat harganya di GPT 5.6 Luna. Luna, dengan $0.18 untuk input dan $1.08 untuk output, disebut di katalog sebagai tingkat volume tinggi untuk chat, klasifikasi, dan langkah agen yang ringan. Terra lebih murah daripada GPT 5.5 baik untuk input maupun output, jadi untuk integrasi baru ini adalah pilihan kelas menengah yang lebih murah. Output bertarif 6× input pada model 5.5 dan 5.6, serta 5× pada Astra — buat jawaban tetap singkat di GPT dan penghematannya besar. Input yang di-cache seharga sepersepuluh tarif input di seluruh lini.
Claude memiliki tiga model, dan Claude Sonnet 5 sejauh ini yang termurah: $0.30 untuk input, $1.50 untuk output. Claude Opus 5 harganya tepat sepuluh kali lipat di kedua sisi, sehingga perutean — Sonnet secara default, Opus untuk kasus yang sulit — layak dibangun sejak hari pertama. Claude Fable 5, yang disetel untuk tulisan panjang, berada di tengah dengan $1.50 / $7.50. Output bertarif 5× input di ketiganya, pembacaan cache seharga sepersepuluh input, dan penulisan cache seharga 1.25× input. Sonnet dan Opus melayani di endpoint yang kompatibel dengan OpenAI maupun yang kompatibel dengan Anthropic; Fable dilayani melalui endpoint Messages yang kompatibel dengan Anthropic.
Gemini membuat harga input tetap sama: setiap model Flash berharga $0.90 per satu juta token input. Perbedaannya ada di output — 3.6 Flash dan 3.7 Flash mengenakan $4.50, 3.5 Flash $5.40. Varian High mengunci 3.5 Flash pada anggaran penalaran yang besar dan harganya 1.8× 3.5 Flash standar di setiap tarif. Jika Anda memilih versi Gemini hanya berdasarkan harga, 3.6 dan 3.7 Flash sama saja. Input yang di-cache seharga sepersepuluh input.
DeepSeek memiliki token termurah di katalog. DeepSeek V4 Flash berharga $0.168 untuk input dan $0.336 untuk output, dan output-nya hanya 2× input — selisih terkecil di antara semua model di sini, jadi tetap murah meski jawabannya panjang. V4 Pro sekitar tiga kali lebih mahal, tetapi tarif output-nya yang $1.044 masih di bawah GPT 5.6 Luna. Kekurangannya ada pada caching: katalog tidak mencantumkan tarif cache untuk kedua model DeepSeek, dan itu berpengaruh pada beban kerja yang berat di prompt (lihat contoh kedua di bawah).
Grok memberi harga yang sama untuk Grok 4.5 dan Grok 4.6, yaitu $2.10 / $6.30, jadi tidak ada alasan biaya untuk bertahan di 4.5. Output hanya 3× input, tetapi diskon cache-nya lebih kecil daripada lini lain: token yang di-cache berharga seperempat tarif input ($0.525), bukan sepersepuluh. Keduanya tercantum dengan konteks 500K token.
Kimi memiliki satu model frontier dan satu tingkat untuk coding. Kimi K3 dihargai mendekati Claude Opus 5 ($3.15 / $15.75). Kimi K2.7 Code, yang dibuat untuk pengeditan skala repositori, harganya sekitar sepertiganya, dan menagih penulisan cache dengan tarif rendah yang sama seperti pembacaan cache ($0.111), sehingga menyimpan konteks repositori yang besar tidak dikenai penalti.
Sisa katalog mengisi celah antara DeepSeek dan kelas menengah: Qwen3.7 Plus dan MiniMax M3 berharga sekitar $0.35 untuk input dan $1.40 untuk output, sedangkan GLM 5.2 dan GLM 5.3 berharga $0.98–$1.68 untuk input dan $3.43–$5.28 untuk output.
Contoh perhitungan biaya
Tiga beban kerja, dihitung dengan tarif katalog di atas. Total hanya mencakup biaya token.
1. Bot layanan pelanggan
5.000 percakapan sebulan, masing-masing mengirim sekitar 2.000 token input (system prompt, riwayat, pesan pelanggan) dan menerima sekitar 400 token jawaban. Totalnya 10 juta token input + 2 juta token output.
Di Claude Sonnet 5 perhitungannya 10 × $0.30 + 2 × $1.50 = $3.00 + $3.00.
| Model | Input | Output | Sebulan |
|---|---|---|---|
| DeepSeek V4 Flash | $1.68 | $0.67 | $2.35 |
| GPT 5.6 Luna | $1.80 | $2.16 | $3.96 |
| Claude Sonnet 5 | $3.00 | $3.00 | $6.00 |
| DeepSeek V4 Pro | $5.22 | $2.09 | $7.31 |
| GPT 5.6 Terra | $8.00 | $9.60 | $17.60 |
| Gemini 3.7 Flash | $9.00 | $9.00 | $18.00 |
| Grok 4.6 | $21.00 | $12.60 | $33.60 |
| Claude Opus 5 | $30.00 | $30.00 | $60.00 |
Bahkan dengan lima token input untuk setiap token output, output mengambil separuh tagihan atau lebih di GPT, Claude, dan Gemini. DeepSeek V4 Flash memiliki tarif terendah di kedua sisi, jadi unggul dengan nyaman.
2. Asisten dengan prompt tetap yang besar
Sebuah asisten produk menjawab 10.000 pertanyaan sebulan. Setiap permintaan mengirim blok 1.600 token yang sama — instruksi ditambah paket referensi — diikuti sekitar 400 token pertanyaan dan riwayat, lalu menerima jawaban 100 token. Dengan prompt caching aktif, totalnya 16 juta di-cache + 4 juta input baru + 1 juta output.
Di Claude Sonnet 5: 16 × $0.03 + 4 × $0.30 + 1 × $1.50 = $0.48 + $1.20 + $1.50.
| Model | Di-cache | Input baru | Output | Dengan cache | Tanpa cache |
|---|---|---|---|---|---|
| GPT 5.6 Luna | $0.29 | $0.72 | $1.08 | $2.09 | $4.68 |
| Claude Sonnet 5 | $0.48 | $1.20 | $1.50 | $3.18 | $7.50 |
| DeepSeek V4 Flash | — | $3.36 | $0.34 | $3.70 | $3.70 |
| GPT 5.6 Terra | $1.28 | $3.20 | $4.80 | $9.28 | $20.80 |
| Gemini 3.7 Flash | $1.44 | $3.60 | $4.50 | $9.54 | $22.50 |
| Grok 4.6 | $8.40 | $8.40 | $6.30 | $23.10 | $48.30 |
| Claude Opus 5 | $4.80 | $12.00 | $15.00 | $31.80 | $75.00 |
Di sinilah urutannya berbalik. Tanpa caching, DeepSeek V4 Flash akan menjadi yang termurah; dengan caching, GPT 5.6 Luna dan Claude Sonnet 5 sama-sama lebih murah, karena DeepSeek menagih seluruh 20 juta token input dengan tarif penuh. Caching memangkas tagihan sebesar 55–58% pada model GPT, Claude, dan Gemini di sini, dan sekitar 52% pada Grok, di mana token yang di-cache berharga seperempat, bukan sepersepuluh. Tabel ini tidak memasukkan biaya penulisan cache satu kali pada model yang mencantumkannya; untuk prefiks yang digunakan ulang ribuan kali, nilainya hanya selisih pembulatan.
3. Pekerjaan ringkasan secara batch
Anda meringkas 5.000 dokumen berukuran sekitar 8.000 token masing-masing menjadi ringkasan 400 token. Setiap dokumen berbeda, jadi tidak ada yang bisa di-cache: 40 juta input + 2 juta output.
| Model | Input | Output | Pekerjaan |
|---|---|---|---|
| DeepSeek V4 Flash | $6.72 | $0.67 | $7.39 |
| GPT 5.6 Luna | $7.20 | $2.16 | $9.36 |
| Claude Sonnet 5 | $12.00 | $3.00 | $15.00 |
| Qwen3.7 Plus | $13.72 | $2.74 | $16.46 |
| MiniMax M3 | $14.40 | $2.88 | $17.28 |
| DeepSeek V4 Pro | $20.88 | $2.09 | $22.97 |
| GPT 5.6 Terra | $32.00 | $9.60 | $41.60 |
| Gemini 3.7 Flash | $36.00 | $9.00 | $45.00 |
Di sini input 20 kali output, jadi tarif input menentukan hampir segalanya. Jalankan sampel seratus dokumen melalui dua atau tiga kandidat, bandingkan ringkasannya, dan hitung totalnya sebelum menjalankan seluruh batch.
Cara menekan tagihan
- Nyalakan prompt caching untuk apa pun yang berulang. Letakkan bagian prompt yang stabil — instruksi, definisi tool, materi referensi — di depan dan bagian yang berubah di akhir, agar prefiksnya identik dari satu permintaan ke permintaan berikutnya. Token yang di-cache ditagih dengan tarif cache model, selama model itu memilikinya. Agen coding dan chat multi-giliran, yang mengirim ulang konteks yang terus bertambah di setiap langkah, paling diuntungkan.
- Batasi output. Output adalah arah yang mahal, jadi atur
max_tokensdan minta format yang Anda butuhkan: sebuah label, objek JSON, tiga poin. Model yang diminta "jawaban singkat" tetap memutuskan sendiri seberapa singkat itu. - Draf dengan yang murah, selesaikan dengan yang mahal. Gunakan tingkat berbiaya rendah — DeepSeek V4 Flash, GPT 5.6 Luna, Claude Sonnet 5 — untuk klasifikasi, ekstraksi, draf pertama, dan perutean, lalu kirim ke Opus, Sol, atau Astra hanya permintaan yang memang membutuhkannya. Dengan selisih harga 10×, router yang meneruskan satu dari sepuluh permintaan ke model atas biayanya tetap jauh di bawah separuh biaya mengirim semuanya ke model teratas.
- Pangkas yang Anda kirim ulang. Ringkas giliran lama alih-alih memutar ulang seluruh riwayat, dan ambil potongan yang lebih sedikit tetapi lebih relevan. Setiap token yang tidak Anda kirim adalah token yang tidak Anda bayar, di-cache atau tidak.
- Bandingkan dengan trafik Anda sendiri. Contoh perhitungan menunjukkan
bahwa model termurah bergantung pada komposisi input/output dan pada
caching. Catat
usagedari satu hari permintaan nyata dan hitung biayanya di dua atau tiga model.
Memanggil semuanya dengan satu kunci
Setiap model di tabel berjalan dengan satu kunci API Stock dan satu saldo prabayar — saldo yang sama untuk membayar pembuatan video, gambar, dan musik. Tidak ada langganan dan tidak perlu akun per vendor: Anda mengisi saldo, dan setiap permintaan ditagih sesuai token yang digunakannya. Jika sebuah penyedia gagal, permintaan dicoba ulang di penyedia cadangan, dan permintaan yang gagal di semua penyedia akan dikembalikan dananya.
Endpoint yang kompatibel dengan OpenAI adalah POST /api/v1/chat/completions.
Dengan SDK resmi OpenAI, arahkan base URL ke API Stock dan gunakan kunci API
Stock Anda; berganti model cukup dengan mengganti string model.
import OpenAI from "openai";const client = new OpenAI({apiKey: process.env.API_STOCK_KEY,baseURL: "https://api.api-stock.com/api/v1",});const completion = await client.chat.completions.create({model: "deepseek-v4-flash", // atau "gpt-5.6-luna", "claude-sonnet-5", "gemini-3.7-flash"…max_tokens: 300,messages: [{ role: "system", content: "You are a concise support assistant." },{ role: "user", content: "How do I reset my password?" },],});console.log(completion.choices[0].message.content);console.log(completion.usage); // jumlah token yang menjadi dasar tagihan permintaan
Endpoint yang kompatibel dengan Anthropic adalah POST /api/v1/messages.
Endpoint ini menerima format permintaan Anthropic, dengan max_tokens wajib
diisi:
curl -X POST https://api.api-stock.com/api/v1/messages \-H "Authorization: Bearer $API_STOCK_KEY" \-H "Content-Type: application/json" \-d '{"model": "claude-sonnet-5","max_tokens": 300,"messages": [{ "role": "user", "content": "How do I reset my password?" }]}'
Parameter, streaming, dan penanganan error ada di referensi Chat Completions dan referensi Messages. Sebelum go-live, checklist produksi membahas pengelolaan kunci dan pemantauan saldo.
Pertanyaan yang sering diajukan
Berapa biaya API Gemini?
Dengan tarif katalog, setiap model Gemini Flash berharga $0.90 per satu juta token input. Output berharga $4.50 per satu juta di Gemini 3.6 dan 3.7 Flash, $5.40 di 3.5 Flash, dan $9.72 di 3.5 Flash (High). Input yang di-cache berharga $0.09 per satu juta ($0.162 di High). Harga terkini ada di halaman keluarga Gemini.
Berapa biaya API Claude?
Claude Sonnet 5 berharga $0.30 per satu juta token input dan $1.50 per satu juta token output, Claude Fable 5 $1.50 / $7.50, dan Claude Opus 5 $3 / $15. Input yang di-cache seharga sepersepuluh tarif input di ketiganya. Lihat tabel terbaru di halaman keluarga Claude.
Apakah DeepSeek API LLM termurah?
Per token, ya: DeepSeek V4 Flash, dengan $0.168 untuk input dan $0.336 untuk output, adalah model dengan harga terendah di katalog. Begitu sebagian besar prompt Anda bisa di-cache, GPT 5.6 Luna dan Claude Sonnet 5 bisa jadi lebih murah, karena DeepSeek tidak punya tarif cache — contoh perhitungan kedua di atas menunjukkan seberapa besar selisihnya.
Bagaimana cara mendapatkan API key Claude, Gemini, atau DeepSeek?
Anda tidak perlu satu kunci per vendor. Daftar di API Stock, isi saldo berapa pun, dan buat API key di dasbor. Kunci yang sama bisa memanggil GPT, Claude, Gemini, DeepSeek, Grok, Kimi, dan semua model lain di katalog.
API LLM mana yang paling murah untuk beban kerja saya?
Kalikan token input, output, dan cache bulanan Anda dengan tarif setiap kandidat, seperti pada contoh di atas. Prompt pendek dengan jawaban panjang diuntungkan oleh tarif output yang rendah; prompt panjang yang berulang diuntungkan oleh tarif cache yang murah; dokumen panjang sekali pakai diuntungkan oleh tarif input yang rendah. Mulailah dari halaman harga dan halaman keluarga untuk GPT, Claude, Gemini, DeepSeek, Grok, dan Kimi.
Jalankan dengan kunci Anda sendiri
Semua model dalam panduan ini tersedia di katalog API Stock — satu kunci API, satu saldo prabayar, tanpa pendaftaran terpisah di tiap penyedia.