Chat y LLM
Precios de API LLM: GPT, Claude, Gemini y DeepSeek comparados
Compare los precios de API LLM de GPT, Claude, Gemini, DeepSeek, Grok y Kimi por 1 M de tokens, con costes mensuales calculados y formas de reducir la factura.
«¿Cuánto cuesta la API de Claude?» no tiene una única respuesta, porque nadie paga por solicitud. Una API de modelos de lenguaje factura tokens, y los factura a dos o tres tarifas distintas según la dirección en la que viajan. El mismo chatbot puede costar $2 al mes con un modelo y $60 con otro, y el orden entre dos modelos puede invertirse en cuanto se activa el caché de prompts.
Esta guía reúne los precios actuales de todos los modelos de chat del catálogo de API Stock — GPT, Claude, Gemini, DeepSeek, Grok, Kimi y algunos más — y después calcula tres cargas de trabajo realistas para que vea qué significan las cifras por token en una factura mensual. Está pensada para desarrolladores que eligen un modelo para un producto, y para cualquiera que haya buscado «precio de la API de Gemini» y se haya encontrado una tabla sin un solo ejemplo calculado.
Qué se paga realmente
Todos los precios de esta guía se expresan por 1 millón de tokens, en USD. Un token es un fragmento de palabra; una página de prosa en inglés ocupa unos cuantos cientos. Importan tres tarifas:
- Tokens de entrada: todo lo que usted envía, es decir, el prompt de sistema, el historial de la conversación, los documentos recuperados y el mensaje del usuario. Reenviar todo el historial en cada turno es la razón por la que la entrada suele dominar una carga de chat.
- Tokens de salida: todo lo que el modelo devuelve. La salida es siempre la dirección más cara: en este catálogo cuesta de 2 a 6 veces la tarifa de entrada del mismo modelo.
- Entrada en caché: la parte del prompt que el proveedor ya ha visto y almacenado. Cuando un modelo tiene tarifa de caché, un token en caché se factura a una pequeña fracción del precio normal de entrada, normalmente una décima parte. Algunos modelos indican además una tarifa de escritura en caché, que se cobra una sola vez cuando se almacena un prefijo por primera vez.
Así que la factura de un mes es simplemente
entrada × tarifa de entrada + salida × tarifa de salida + caché × tarifa de caché + escritura en caché × tarifa de escritura,
dividido entre un millón. El resto de esta guía es esa fórmula aplicada con números
reales.
Precios de API LLM de un vistazo
Precios del catálogo comprobados el 24 de septiembre de 2026, en USD por 1 M de tokens y ordenados por precio de entrada. Las cifras que en el catálogo tienen más decimales se redondean al céntimo. Cada página de modelo muestra la tabla de precios en vivo, y la página de precios reúne todos los modelos en un solo lugar.
| Modelo | Familia | Entrada | Salida | Entrada en caché |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | $0.168 | $0.336 | — |
| GPT 5.6 Luna | GPT | $0.18 | $1.08 | $0.018 |
| Claude Sonnet 5 | Claude | $0.30 | $1.50 | $0.03 |
| Qwen3.7 Plus | Qwen | $0.34 | $1.37 | $0.034 |
| MiniMax M3 | MiniMax | $0.36 | $1.44 | $0.036 |
| DeepSeek V4 Pro | DeepSeek | $0.522 | $1.044 | — |
| GPT 5.6 Terra | GPT | $0.80 | $4.80 | $0.08 |
| Gemini 3.6 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.7 Flash | Gemini | $0.90 | $4.50 | $0.09 |
| Gemini 3.5 Flash | Gemini | $0.90 | $5.40 | $0.09 |
| GLM 5.2 | GLM | $0.98 | $3.43 | $0.098 |
| Kimi K2.7 Code | Kimi | $1.11 | $4.62 | $0.111 |
| GPT 5.5 | GPT | $1.50 | $9.00 | $0.15 |
| Claude Fable 5 | Claude | $1.50 | $7.50 | $0.15 |
| Gemini 3.5 Flash (High) | Gemini | $1.62 | $9.72 | $0.162 |
| GLM 5.3 | GLM | $1.68 | $5.28 | $0.312 |
| Grok 4.5 | Grok | $2.10 | $6.30 | $0.525 |
| Grok 4.6 | Grok | $2.10 | $6.30 | $0.525 |
| GPT 5.6 Sol | GPT | $3.00 | $18.00 | $0.30 |
| Claude Opus 5 | Claude | $3.00 | $15.00 | $0.30 |
| Kimi K3 | Kimi | $3.15 | $15.75 | $0.315 |
| GPT 6 Astra | GPT | $8.00 | $40.00 | $0.80 |
Un guion significa que el catálogo no indica tarifa de entrada en caché para ese modelo, así que cada token de entrada se factura al precio completo. Estos son los precios de API Stock, independientes de los precios directos de cada proveedor.
Qué línea elegir y cuándo
Una tabla de precios ordena los modelos por coste, no por adecuación. Las notas siguientes se limitan a lo que dicen las cifras de cada línea; qué modelo escribe la respuesta que usted necesita es algo que conviene probar con sus propios prompts.
GPT abarca el rango más amplio de todas las familias: la entrada en GPT 6 Astra cuesta más de cuarenta veces lo que cuesta en GPT 5.6 Luna. Luna, a $0.18 de entrada y $1.08 de salida, aparece en el catálogo como el nivel de alto volumen para chat, clasificación y pasos ligeros de agentes. Terra está por debajo de GPT 5.5 tanto en entrada como en salida, así que para una integración nueva es la opción de gama media más barata. La salida cuesta 6× la entrada en los modelos 5.5 y 5.6, y 5× en Astra: mantenga las respuestas cortas en GPT y el ahorro será grande. La entrada en caché cuesta una décima parte de la tarifa de entrada en toda la línea.
Claude tiene tres modelos, y Claude Sonnet 5 es con diferencia el más barato: $0.30 de entrada y $1.50 de salida. Claude Opus 5 cuesta exactamente diez veces más en ambos lados, lo que hace que merezca la pena construir un enrutamiento desde el primer día: Sonnet por defecto, Opus para los casos difíciles. Claude Fable 5, ajustado para textos largos, queda en medio con $1.50 / $7.50. La salida cuesta 5× la entrada en los tres, las lecturas en caché cuestan una décima parte de la entrada y una escritura en caché cuesta 1.25× la entrada. Sonnet y Opus responden tanto en el endpoint compatible con OpenAI como en el compatible con Anthropic; Fable se sirve a través del endpoint Messages compatible con Anthropic.
Gemini mantiene la entrada plana: todos los modelos Flash cuestan $0.90 por millón de tokens de entrada. La diferencia está en la salida: 3.6 Flash y 3.7 Flash cobran $4.50, y 3.5 Flash, $5.40. La variante High fija 3.5 Flash a un presupuesto de razonamiento amplio y cuesta 1.8× el 3.5 Flash estándar en todas las tarifas. Si elige entre versiones de Gemini solo por precio, 3.6 y 3.7 Flash son iguales. La entrada en caché cuesta una décima parte de la entrada.
DeepSeek tiene los tokens más baratos del catálogo. DeepSeek V4 Flash cuesta $0.168 de entrada y $0.336 de salida, y su salida es solo 2× su entrada, la diferencia más pequeña de todos los modelos de aquí, así que sigue siendo barato aunque las respuestas sean largas. V4 Pro cuesta unas tres veces más, pero su tarifa de salida de $1.044 sigue por debajo de la de GPT 5.6 Luna. El inconveniente es el caché: el catálogo no indica tarifa de caché para ninguno de los dos modelos DeepSeek, y eso pesa en las cargas con prompts extensos (vea el segundo ejemplo más abajo).
Grok pone el mismo precio a Grok 4.5 y Grok 4.6, $2.10 / $6.30, así que no hay ninguna razón de coste para quedarse en 4.5. La salida es solo 3× la entrada, pero el descuento por caché es menor que en otras líneas: un token en caché cuesta una cuarta parte de la tarifa de entrada ($0.525), no una décima. Ambos figuran con un contexto de 500K tokens.
Kimi tiene un modelo frontier y un nivel para programación. Kimi K3 tiene un precio cercano al de Claude Opus 5 ($3.15 / $15.75). Kimi K2.7 Code, creado para ediciones a escala de repositorio, cuesta aproximadamente un tercio de eso y factura la escritura en caché a la misma tarifa baja que la lectura ($0.111), así que almacenar un contexto de repositorio grande no sale penalizado.
El resto del catálogo cubre el hueco entre DeepSeek y la gama media: Qwen3.7 Plus y MiniMax M3 cuestan alrededor de $0.35 de entrada y $1.40 de salida, mientras que GLM 5.2 y GLM 5.3 cuestan $0.98–$1.68 de entrada y $3.43–$5.28 de salida.
Ejemplos de coste calculados
Tres cargas de trabajo, calculadas con las tarifas del catálogo de arriba. Los totales solo incluyen el cargo por tokens.
1. Un bot de atención al cliente
5000 conversaciones al mes; cada una envía unos 2000 tokens de entrada (prompt de sistema, historial y mensaje del cliente) y recibe unos 400 tokens de respuesta. En total, 10 M de tokens de entrada + 2 M de salida.
Con Claude Sonnet 5 la cuenta es 10 × $0.30 + 2 × $1.50 = $3.00 + $3.00.
| Modelo | Entrada | Salida | Mes |
|---|---|---|---|
| DeepSeek V4 Flash | $1.68 | $0.67 | $2.35 |
| GPT 5.6 Luna | $1.80 | $2.16 | $3.96 |
| Claude Sonnet 5 | $3.00 | $3.00 | $6.00 |
| DeepSeek V4 Pro | $5.22 | $2.09 | $7.31 |
| GPT 5.6 Terra | $8.00 | $9.60 | $17.60 |
| Gemini 3.7 Flash | $9.00 | $9.00 | $18.00 |
| Grok 4.6 | $21.00 | $12.60 | $33.60 |
| Claude Opus 5 | $30.00 | $30.00 | $60.00 |
Incluso con cinco tokens de entrada por cada token de salida, la salida supone la mitad de la factura o más en GPT, Claude y Gemini. DeepSeek V4 Flash tiene la tarifa más baja en ambos lados, así que va cómodamente en cabeza.
2. Un asistente con un prompt fijo grande
Un asistente de producto responde 10 000 preguntas al mes. Cada solicitud envía el mismo bloque de 1600 tokens — instrucciones más un paquete de referencia — seguido de unos 400 tokens de pregunta e historial, y recibe una respuesta de 100 tokens. Con el caché de prompts activado, eso son 16 M en caché + 4 M de entrada nueva + 1 M de salida.
Con Claude Sonnet 5: 16 × $0.03 + 4 × $0.30 + 1 × $1.50 = $0.48 + $1.20 + $1.50.
| Modelo | En caché | Entrada nueva | Salida | Con caché | Sin caché |
|---|---|---|---|---|---|
| GPT 5.6 Luna | $0.29 | $0.72 | $1.08 | $2.09 | $4.68 |
| Claude Sonnet 5 | $0.48 | $1.20 | $1.50 | $3.18 | $7.50 |
| DeepSeek V4 Flash | — | $3.36 | $0.34 | $3.70 | $3.70 |
| GPT 5.6 Terra | $1.28 | $3.20 | $4.80 | $9.28 | $20.80 |
| Gemini 3.7 Flash | $1.44 | $3.60 | $4.50 | $9.54 | $22.50 |
| Grok 4.6 | $8.40 | $8.40 | $6.30 | $23.10 | $48.30 |
| Claude Opus 5 | $4.80 | $12.00 | $15.00 | $31.80 | $75.00 |
Aquí es donde se invierte el orden. Sin caché, DeepSeek V4 Flash sería el más barato; con caché, tanto GPT 5.6 Luna como Claude Sonnet 5 lo superan, porque DeepSeek factura los 20 M de tokens de entrada a la tarifa completa. El caché reduce la factura en un 55–58% en los modelos GPT, Claude y Gemini de esta tabla, y alrededor de un 52% en Grok, donde los tokens en caché cuestan una cuarta parte y no una décima. La tabla no incluye el cargo único por escritura en caché de los modelos que lo tienen; para un prefijo reutilizado miles de veces, es un error de redondeo.
3. Un trabajo de resumen por lotes
Usted resume 5000 documentos de unos 8000 tokens cada uno en un resumen de 400 tokens. Cada documento es distinto, así que no hay nada que cachear: 40 M de entrada + 2 M de salida.
| Modelo | Entrada | Salida | Trabajo |
|---|---|---|---|
| DeepSeek V4 Flash | $6.72 | $0.67 | $7.39 |
| GPT 5.6 Luna | $7.20 | $2.16 | $9.36 |
| Claude Sonnet 5 | $12.00 | $3.00 | $15.00 |
| Qwen3.7 Plus | $13.72 | $2.74 | $16.46 |
| MiniMax M3 | $14.40 | $2.88 | $17.28 |
| DeepSeek V4 Pro | $20.88 | $2.09 | $22.97 |
| GPT 5.6 Terra | $32.00 | $9.60 | $41.60 |
| Gemini 3.7 Flash | $36.00 | $9.00 | $45.00 |
Aquí la entrada es 20 veces la salida, así que la tarifa de entrada lo decide casi todo. Pase una muestra de cien documentos por dos o tres candidatos, compare los resúmenes y multiplique antes de lanzar el lote completo.
Cómo reducir la factura
- Active el caché de prompts para todo lo que se repite. Ponga primero la parte estable del prompt — instrucciones, definiciones de herramientas, material de referencia — y al final la parte que cambia, para que el prefijo sea idéntico de una solicitud a la siguiente. Los tokens en caché se facturan a la tarifa de caché del modelo siempre que la tenga. Los agentes de programación y los chats de varios turnos, que reenvían un contexto cada vez mayor en cada paso, son los que más ganan.
- Limite la salida. La salida es la dirección cara, así que fije
max_tokensy pida el formato que necesita: una etiqueta, un objeto JSON, tres viñetas. Un modelo al que se le pide «una respuesta corta» sigue decidiendo qué significa corta. - Borradores con lo barato, acabado con lo caro. Use un nivel económico — DeepSeek V4 Flash, GPT 5.6 Luna, Claude Sonnet 5 — para clasificación, extracción, primeros borradores y enrutamiento, y envíe a Opus, Sol o Astra solo las solicitudes que lo necesitan. Con una diferencia de precio de 10×, un enrutador que escala una solicitud de cada diez sigue costando bastante menos de la mitad que enviarlo todo al modelo más potente.
- Recorte lo que reenvía. Resuma los turnos antiguos en lugar de repetir el historial completo, y recupere menos fragmentos pero mejores. Cada token que no envía es un token que no paga, esté en caché o no.
- Compare con su propio tráfico. Los ejemplos calculados muestran que el
modelo más barato depende de la proporción entre entrada y salida y del
caché. Registre
usagedurante un día de solicitudes reales y calcule el coste con dos o tres modelos.
Llamar a cualquiera de ellos con una sola clave
Todos los modelos de la tabla funcionan con una clave de API Stock y un único saldo prepago, el mismo que paga la generación de vídeo, imágenes y música. No hay suscripción ni cuenta por proveedor: usted recarga saldo y cada solicitud se cobra por los tokens que ha usado. Si un proveedor falla, la solicitud se reintenta en un proveedor de reserva, y una solicitud que falla en todos se reembolsa.
El endpoint compatible con OpenAI es POST /api/v1/chat/completions. Con el
SDK oficial de OpenAI, apunte la URL base a API Stock y use su clave de API
Stock; cambiar de modelo es cambiar la cadena model.
import OpenAI from "openai";const client = new OpenAI({apiKey: process.env.API_STOCK_KEY,baseURL: "https://api.api-stock.com/api/v1",});const completion = await client.chat.completions.create({model: "deepseek-v4-flash", // o "gpt-5.6-luna", "claude-sonnet-5", "gemini-3.7-flash"…max_tokens: 300,messages: [{ role: "system", content: "You are a concise support assistant." },{ role: "user", content: "How do I reset my password?" },],});console.log(completion.choices[0].message.content);console.log(completion.usage); // los recuentos de tokens por los que se factura la solicitud
El endpoint compatible con Anthropic es POST /api/v1/messages. Acepta el
formato de solicitud de Anthropic, en el que max_tokens es obligatorio:
curl -X POST https://api.api-stock.com/api/v1/messages \-H "Authorization: Bearer $API_STOCK_KEY" \-H "Content-Type: application/json" \-d '{"model": "claude-sonnet-5","max_tokens": 300,"messages": [{ "role": "user", "content": "How do I reset my password?" }]}'
Los parámetros, el streaming y el manejo de errores están en la referencia de Chat Completions y en la referencia de Messages. Antes de pasar a producción, la lista de verificación para producción cubre la gestión de claves y la supervisión del saldo.
Preguntas frecuentes
¿Cuánto cuesta la API de Gemini?
Con las tarifas del catálogo, todos los modelos Gemini Flash cuestan $0.90 por millón de tokens de entrada. La salida cuesta $4.50 por millón en Gemini 3.6 y 3.7 Flash, $5.40 en 3.5 Flash y $9.72 en 3.5 Flash (High). La entrada en caché cuesta $0.09 por millón ($0.162 en High). Los precios en vivo están en la página de la familia Gemini.
¿Cuánto cuesta la API de Claude?
Claude Sonnet 5 cuesta $0.30 por millón de tokens de entrada y $1.50 por millón de tokens de salida; Claude Fable 5, $1.50 / $7.50; y Claude Opus 5, $3 / $15. La entrada en caché cuesta una décima parte de la tarifa de entrada en los tres. Consulte la tabla actual en la página de la familia Claude.
¿Es DeepSeek la API LLM más barata?
Por token, sí: DeepSeek V4 Flash, a $0.168 de entrada y $0.336 de salida, es el modelo más barato del catálogo. Cuando la mayor parte de su prompt se puede cachear, GPT 5.6 Luna y Claude Sonnet 5 pueden salir más baratos, porque DeepSeek no tiene tarifa de caché; el segundo ejemplo calculado muestra por cuánto.
¿Cómo consigo una clave de API de Claude, Gemini o DeepSeek?
No necesita una por proveedor. Regístrese en API Stock, recargue su saldo con cualquier importe y cree una clave de API en el panel. La misma clave llama a GPT, Claude, Gemini, DeepSeek, Grok, Kimi y a cualquier otro modelo del catálogo.
¿Qué API LLM es la más barata para mi carga de trabajo?
Multiplique sus tokens mensuales de entrada, salida y caché por las tarifas de cada candidato, como en los ejemplos anteriores. Los prompts cortos con respuestas largas favorecen una tarifa de salida baja; los prompts largos y repetidos, una tarifa de caché barata; los documentos largos y únicos, una tarifa de entrada baja. Empiece por la página de precios y las páginas de familia de GPT, Claude, Gemini, DeepSeek, Grok y Kimi.
Ejecútalo con tu propia clave
Todos los modelos de esta guía están disponibles en el catálogo de API Stock: una clave de API, un saldo prepago y ningún registro aparte por proveedor.