El precio del token, de GPT-4 a hoy: la caída y el techo que vuelve a subir
Tarifas oficiales de catorce laboratorios y el catálogo entero de OpenRouter, 437 modelos con su fecha de alta. Qué le ha pasado al precio por millón de tokens desde que China llegó a la frontera.
Esta semana, con GPT-6 Astra y Claude Fable 5.1 recién puestos a la venta, el
modelo más caro del mercado vuelve a costar lo que costaba en 2023. No es una
impresión: es lo que sale de cruzar las tarifas oficiales de catorce
laboratorios con el catálogo completo de OpenRouter —437 modelos, cada uno con
su precio y su fecha de alta— y ordenarlo por fechas. Los números, con su fuente
y su fecha de consulta, están en src/data/precios-tokens.json de este sitio.
Todo va en dólares por millón de tokens, entrada y salida por separado, y las cifras son de las páginas de tarifas de cada laboratorio, consultadas el 10 de septiembre de 2026.
Lo que costaba un token y lo que cuesta
En mayo de 2023, GPT-4 salía a 30 de entrada y 60 de salida. Hoy, en el mismo catálogo, hay modelos de pago con la salida por debajo de 0,07: Ling 3.0 Flash, de Ant (蚂蚁), a 0,021 / 0,063, y el suelo absoluto lo marca un europeo, el veterano Mistral Nemo, a 0,019 / 0,03. Sin bajar a la gama de saldo, la tarifa de valle de DeepSeek Flash —0,15 / 0,60— ya es cien veces más barata que aquel GPT-4. Catálogo de OpenRouter · Tarifas de DeepSeek.
La caída no fue una pendiente suave. Tiene fechas:
| Fecha | Modelo | Entrada | Salida |
|---|---|---|---|
| 28/05/2023 | GPT-4 (OpenAI) | 30,00 | 60,00 |
| 09/04/2024 | GPT-4 Turbo | 10,00 | 30,00 |
| 06/08/2024 | GPT-4o (recorte de agosto) | 2,50 | 10,00 |
| 17/12/2024 | o1 (OpenAI) | 15,00 | 60,00 |
| 26/12/2024 | DeepSeek V3 | 0,26 | 1,03 |
| 20/01/2025 | DeepSeek R1 | 0,70 | 2,50 |
| 22/05/2025 | Claude Opus 4 | 15,00 | 75,00 |
| 07/08/2025 | GPT-5 | 1,25 | 10,00 |
| 24/11/2025 | Claude Opus 4.5 | 5,00 | 25,00 |
| 16/07/2026 | Kimi K3 (Moonshot) | 3,00 | 15,00 |
| 01/09/2026 | Claude Fable 5.1 | 10,00 | 50,00 |
| 04/09/2026 | GPT-6 Astra | 10,00 | 50,00 |
Fecha de alta en el catálogo de OpenRouter y precio de lista vigente el 10/09/2026.
Fíjate en el par de líneas de finales de 2024. El 17 de diciembre o1 se pone a 60 de salida. Nueve días después, DeepSeek (深度求索) publica V3 a 1,03. No es una rebaja: es otra escala. Un mes más tarde llega R1 y el argumento deja de ser «barato pero peor», porque el modelo razona.
Lo que vino después en América no fue retórica. Entre o1 y GPT-5 (agosto de 2025) la salida del buque insignia de OpenAI pasó de 60 a 10: seis veces menos en ocho meses. Anthropic recortó Opus de 15/75 a 5/25 con la 4.5, y su caballo de batalla, Sonnet 5, está en 2/10 — con un detalle revelador: la subida a 3/15 que la propia Anthropic tenía anunciada para el 1 de septiembre de 2026 se canceló y el precio de lanzamiento se quedó como definitivo. Tarifas de OpenAI · Tarifas de Anthropic.
El techo ha vuelto a subir
Aquí se rompe el relato cómodo. Los tres modelos de gama alta más recientes del catálogo son más caros que los insignia de hace un año: GPT-6 Astra (04/09) y Claude Fable 5.1 (01/09) a 10/50 —cinco veces la salida de GPT-5— y Kimi K3, de Moonshot (月之暗面), a 3/15, más de tres veces la salida de GLM-5.3 y veinticinco veces la del flash de DeepSeek. Tarifas de Kimi · Tarifas de Z.ai.
El mercado no baja en bloque: se ha partido en un suelo de materia prima que sigue hundiéndose y un tramo premium que se reconstruye por encima, ahora con laboratorios chinos dentro. Que Moonshot pida 15 de salida es el dato del trimestre: un lab chino apostando a que su modelo se compra por lo que hace y no por lo que cuesta.
La brecha está en la salida
Con las fechas de alta se puede medir la mediana de lo que cuesta un modelo estrenado en cada trimestre, separando por bloque. Es una foto ruidosa —la mezcla de modelos cambia cada trimestre— pero el patrón aguanta:
| Trimestre | Salida, mediana América | Salida, mediana China | Veces |
|---|---|---|---|
| 2025-T1 | 4,40 | 1,05 | ×4,2 |
| 2025-T2 | 6,20 | 1,08 | ×5,7 |
| 2025-T3 | 2,00 | 1,10 | ×1,8 |
| 2025-T4 | 10,00 | 1,02 | ×9,8 |
| 2026-T1 | 5,25 | 1,23 | ×4,3 |
| 2026-T2 | 9,50 | 1,74 | ×5,5 |
| 2026-T3 | 3,90 | 0,63 | ×6,2 |
Mediana del precio de salida de los modelos dados de alta en cada trimestre, sobre el catálogo de OpenRouter. Cálculo propio.
Seis trimestres seguidos con la mediana china en una banda estrecha, entre 1 y 1,7, mientras la americana oscilaba entre 2 y 10. Este trimestre la china cae a 0,63, su mínimo de la serie.
En la entrada la distancia es mucho menor, y en el suelo casi no existe: Amazon vende Nova Micro a 0,03 / 0,12 y OpenAI tiene gpt-5-nano a 0,05 / 0,40. Es decir: la ventaja china no está en lo barato, está en lo caro. Cuando compras razonamiento —tokens de pensamiento, que se facturan como salida— la diferencia se multiplica, y ahí vive el gasto de cualquier agente. Tarifas de Bedrock.
Cinco cosas que solo se ven leyendo las tarifas chinas
- Precio por horas. DeepSeek cobra la mitad fuera de hora punta: 0,15 / 0,60 en valle contra 0,30 / 1,20 en punta (01:00–04:00 y 06:00–10:00 UTC, de lunes a viernes). Es tarificación de compañía eléctrica, y no la hace nadie más. Tarifas de DeepSeek.
- Dos listas de precios. El mismo qwen3.8-max de Alibaba (阿里巴巴) cuesta 2,00 / 6,00 servido desde Singapur y 1,65 / 4,95 desde Pekín. En qwen-max la diferencia es brutal: 1,60 / 6,40 fuera contra 0,35 / 1,38 dentro. Facturación de Model Studio.
- La caché como arma. Casi toda la industria ha convergido en cobrar en torno al 10% de la entrada por leer de caché. DeepSeek cobra el 2% (0,003 sobre 0,15). Para un agente que relee el mismo contexto mil veces, ahí está la factura.
- Gratis de verdad. Zhipu (智谱) mantiene GLM-4.7-Flash, GLM-4.5-Flash y GLM-4.6V-Flash a cero. No es una prueba de treinta días: es el precio. Tarifas de Z.ai.
- Contexto largo sin recargo. DeepSeek sirve un millón de tokens a tarifa plana; xAI dobla el precio a partir de 200k y Google sube de tramo por encima de esa cifra. Anthropic es la excepción occidental: incluye el millón sin recargo desde la 4.6. Modelos de xAI · Tarifas de Gemini.
La respuesta americana tampoco es solo bajar el precio. Google vende Gemini 3.8 Flash a 0,75 / 3,75 con fecha de caducidad —el 31/12/2026 pasa a 1,50 / 7,50— y en el catálogo aparece el nivel Contributor de Muse Spark, de Meta, a 0,10 / 0,20 frente a los 1,25 / 4,25 del estándar; la contrapartida, según la cobertura del lanzamiento, es permiso para entrenar con tus prompts. Ya no se compite solo con dinero: se compite con datos. AI Weekly.
Quién se está llevando los tokens
En la semana hasta el 9 de septiembre, el ranking de tokens procesados de OpenRouter tenía ocho modelos chinos entre los diez primeros: Hy4 preview de Tencent (腾讯) el primero con 19,7 billones de tokens, GLM 5.3 Flash y los dos DeepSeek V4 Flash detrás, y MiMo de Xiaomi, Hy3, MiniMax M3 y GLM 5.3 completando. Los dos americanos eran GPT-5.6 Luna, con 12,9 billones, y un Nemotron de NVIDIA que se sirve gratis. Es un agregador occidental, sesgado hacia desarrolladores sensibles al precio y hacia niveles gratuitos: señal de mercado, no cuota global. Ranking de OpenRouter.
Lo que los precios no dicen
Tres avisos, porque sin ellos esto sería propaganda:
- Un token no es una unidad de trabajo. Anthropic documenta que sus modelos desde la 4.7 usan un tokenizador que produce un 30% más de tokens para el mismo texto. Comparar tarifas sin comparar cuántos tokens gasta cada modelo en resolver la misma tarea es comparar el precio del litro sin mirar el consumo. Tarifas de Anthropic.
- Esto no compara capacidad. Aquí no hay benchmarks propios, así que este despacho no dice que GLM-5.3 «sea» Opus 4.5 más barato. Dice lo que cuesta cada uno, con fecha.
- La tarifa de lista no es lo que paga una empresa grande. Los descuentos por volumen no se publican, y en China menos todavía. Tampoco coinciden siempre las dos fuentes: OpenAI publica gpt-5.6-sol a 4/20 y el agregador lo listaba a 2/10 el mismo día.
Mi lectura
El precio por token no está bajando: está estratificándose. La materia prima —resumir, clasificar, extraer, traducir— se va a cero y la servirá quien tenga los chips más ociosos, con China marcando la referencia. Encima se levanta un piso premium donde se paga por el modelo que resuelve la tarea entera a la primera, y ahí el precio sube porque sube el valor.
Lo que cambió en enero de 2025 no fue el precio: fue la obligación de justificarlo. Desde R1, cada lanzamiento americano viene con una explicación de por qué cuesta lo que cuesta. Antes no hacía falta.
Y la cuenta práctica para quien construye: el trabajo de volumen, a un flash chino o a un nano americano, que ahí la diferencia son céntimos; el trabajo que ve el cliente, al modelo que menos veces haya que corregir, y eso se decide con tu propia evaluación, no con la tabla de precios. Antes de firmar nada, mira la letra pequeña — las promociones con fecha, los tramos por longitud de contexto y la cláusula de entrenamiento con tus datos son hoy más dinero que la diferencia entre dos tarifas.
Cada viernes cuento esto con calma en Desde China. Alta gratis.