En noviembre de 2021, generar un millón de tokens de texto con GPT-3 costaba 60 dólares a través de la API. Tres años después, un modelo de al menos esa calidad producía el mismo millón por $0,061: una caída de mil veces, a un ritmo de aproximadamente 10 veces por año, más rápido que la caída de los costes de computación durante la era del PC o del ancho de banda durante el auge de las punto com1. El AI Index de Stanford midió la versión de clase GPT-3.5 de ese mismo desplome en 280 veces en unos dieciocho meses2. Epoch AI, siguiendo precios en distintos benchmarks, encontró que el descenso medio se aceleró hasta unas 200 veces por año desde enero de 20243.
Conviene una nota de comparabilidad desde el principio. Estas caídas de precio son a capacidad equivalente, modelos comparados en el tiempo con la misma referencia de calidad, no el precio del modelo de frontera del momento, y mezclan tokens de entrada y salida, calidad y latencia, precios de lista y negociados. La dirección y el orden de magnitud sobreviven a cualquier ajuste razonable; el multiplicador exacto depende de qué listón de calidad y qué mezcla de tokens se mantenga fija.
Al mismo tiempo, el otro precio del sector se movió en sentido contrario. El coste amortizado de la ejecución final de entrenamiento de un modelo de frontera ha crecido, según la tendencia estimada por Epoch para las ejecuciones de frontera, unas 2,4 veces por año desde 20164. La ejecución de GPT-4 costó decenas de millones de dólares: unos 40 millones según el cálculo amortizado de Epoch, 78 millones a precios de la nube, más de 100 millones según su fabricante4. De mantenerse la tendencia, las ejecuciones más grandes superarán los 1.000 millones de dólares hacia 20274. Usar inteligencia se abarata; crear la frontera de ella se encarece.
Precio por millón de tokens para salida de clase GPT-3, de noviembre de 2021 a noviembre de 2024. Los costes de entrenamiento de frontera crecieron 2,4 veces al año en el mismo periodo.
Por qué cayó el coste de servir modelos
No fue un solo truco; fueron cinco que se acumularon1. Siguieron llegando nuevas generaciones de GPU. La cuantización redujo la aritmética de 16 bits a 4 bits, un factor de cuatro por sí sola. El software de inferencia aprendió a agrupar, almacenar en caché y transmitir para sortear los cuellos de botella de memoria. Las técnicas posteriores al entrenamiento enseñaron a modelos pequeños lo que antes solo sabían los gigantes, así que unos pocos miles de millones de parámetros ahora superan al original de 175.000 millones. Y la publicación de pesos abiertos por parte de Meta, Mistral y laboratorios chinos convirtió el servicio de modelos en un negocio de commodities donde una docena de proveedores compiten hasta el coste marginal de la electricidad.
El último mecanismo es el que más pesa en dónde se estabilizan los precios. Un modelo propietario se fija en su siguiente mejor competidor; uno de pesos abiertos compite contra la factura de la nube de cualquiera. Cada vez que una capacidad de frontera se replica en pesos abiertos, normalmente en uno o dos años, el precio de esa capacidad cae hasta el margen de commodity, y los laboratorios de frontera deben avanzar o ver cómo sus márgenes se reducen. El 280 veces no es generosidad. Es el resultado de la competencia cuando la receta se filtra.
Enero de 2025 dio la demostración canónica. DeepSeek, un laboratorio chino, publicó pesos abiertos casi de frontera junto con un artículo que describía un presupuesto de entrenamiento muy por debajo de lo que el mercado suponía necesario para esa capacidad, y los precios de servicio en todo el sector bajaron en cuestión de semanas. Independientemente de la contabilidad tras la cifra publicada, la lección de mercado quedó clara: el desfase de replicación se había acortado otra vez, y lo había hecho desde una dirección que los controles a la exportación pretendían cerrar. La deflación de precios en este sector no es solo una historia de eficiencia; es también una historia de proliferación.
Por qué la frontera se encarece
El coste de entrenamiento sube porque la capacidad sigue dependiendo de la computación, y en la frontera la computación se compra en unidades de centros de datos de gigavatios y flotas de GPU de seis cifras. El análisis de Epoch atribuye el crecimiento anual de 2,4 veces sobre todo a la cantidad de hardware: clústeres más grandes funcionando más tiempo en chips más caros4. El giro hacia modelos de razonamiento añadió una novedad en 2024-25: modelos que piensan más tiempo por consulta, cuya mejora se paga en parte en la inferencia, por eso o1 de OpenAI salió al mismo precio de 60 dólares por millón de tokens de salida que GPT-3 en su lanzamiento1. El precio de frontera reaparece en la cima de cada ciclo aunque el suelo siga cayendo.
La ejecución de mil millones de dólares tiene una consecuencia que el sector menciona en voz baja: a ese precio, el conjunto de instituciones capaces de financiar un intento de frontera se reduce a unas pocas empresas respaldadas por los mayores balances de la historia corporativa, más los Estados que decidan que esa capacidad es soberana. El crecimiento del coste de entrenamiento es un mecanismo de concentración, el mismo engranaje que opera en la fabricación de chips, donde la factura de capital de cada generación elimina a quienes no pueden pagar la siguiente.
Vivir en el espacio entre las curvas
Cada modelo de negocio en IA es una posición entre estas dos curvas. Las empresas de aplicaciones se benefician de la que cae: una función que era inviable a 20 dólares por millón de tokens es irrelevante a veinte centavos, por eso las capacidades pasan de la demo a lo estándar en cuestión de trimestres. El modelo de negocio de los laboratorios debe superar la que sube: los ingresos de frontera tienen que cubrir el entrenamiento de frontera más la deflación del producto del año pasado convertido en commodity este año. La frase más inquietante en la reunión financiera de un laboratorio de IA no es sobre la competencia; es que el producto que se amortiza se deprecia a un ritmo de 10 veces por año.
El espacio entre ambas también explica los acuerdos estructurales del sector. Los creadores de modelos venden compromisos de computación a las nubes y toman participaciones de ellas porque la factura de entrenamiento necesita un socio con balance; las nubes aceptan porque la inferencia a precios de commodity sigue vendiendo electricidad y racks a volumen. Mientras tanto, los compradores de capacidad de IA siempre encuentran una buena oferta que mejora, con una salvedad: el nivel barato siempre va una generación de capacidad por detrás del caro, y el valor de esa diferencia, meses de ventaja en capacidad, tasada a cientos de veces el precio de commodity, es el producto real que venden los laboratorios de frontera.
Medida | Valor |
|---|---|
Salida de clase GPT-3, nov 2021 | $60 por millón de tokens |
Misma calidad, nov 2024 | $0,06 por millón de tokens |
Caída clase GPT-3.5 | 280 veces en unos 18 meses |
Descenso medio de precio desde ene 2024 | Unas 200 veces por año |
Crecimiento del coste de entrenamiento de frontera | 2,4 veces por año desde 2016 |
Ejecuciones más grandes, en tendencia | Más de 1.000 millones en 2027 |
La cláusula de Jevons
Toda tecnología que se abarata radicalmente cumple la misma observación del siglo XIX: la eficiencia aumenta el consumo. Las máquinas de vapor que ahorraban carbón acabaron quemando más en conjunto; los lúmenes baratos iluminaron la noche; y los tokens a una diezmilésima parte de su precio de 2021 se gastan diezmil veces más, en agentes que leen bases de código enteras, cadenas que redactan y reescriben, productos que llaman a un modelo donde antes llamaban a una base de datos. La deflación no reduce el volumen de ingresos del sector; es lo que permite que ese volumen se expanda a tareas que nunca valían 60 dólares el millón de tokens y ahora claramente valen seis centavos. El precio a la baja es el modelo de negocio.
Para los compradores, las reglas prácticas se desprenden directamente. Nunca firme compromisos largos al precio por token de hoy para los volúmenes de mañana. Construya de modo que el modelo debajo se pueda cambiar, porque el modelo adecuado más barato cambia cada trimestre. Y trate el nivel premium como una opción sobre la ventaja de capacidad, no como una suscripción a inteligencia, renovada solo mientras esa ventaja exista para su tarea. Los departamentos de compras que aprendieron las curvas de depreciación del hardware durante décadas las están reaprendiendo ahora a la velocidad del software.
Lo que la deflación no abarata
El precio decreciente del token oculta el desplazamiento de la factura, no su desaparición. El gasto agregado en inferencia sube aunque el coste unitario caiga, porque el uso crece más rápido que los precios bajan; la expansión de centros de datos se financia exactamente con esa aritmética. Y las cargas de trabajo de razonamiento recomplican la economía unitaria: una consulta que consume diez mil tokens de pensamiento a tarifa baja puede costar más que una que quemaba cien a tarifa alta. Tokens baratos no garantizan respuestas baratas; garantizan que las respuestas caras compran más razonamiento.
Tampoco la deflación llega igual a todas las tareas. Los datos de Epoch muestran los descensos más rápidos donde los benchmarks están saturados y existen reemplazos abiertos, y mucho más lentos en el borde de la capacidad3. Los precios son un mapa de la competencia, y la competencia es un mapa del desfase de replicación. Donde el desfase es corto, los tokens se acercan a gratis; donde una sola empresa mantiene la capacidad, también mantiene el poder de fijar precios, mientras dure su foso, que la historia reciente sugiere que son trimestres, no años.
La consecuencia macro conviene enunciarla: las dos curvas se financian mutuamente. Los cientos de miles de millones en inversión en centros de datos son una apuesta a que la demanda agregada de inferencia, impulsada por la curva descendente, crezca hasta ocupar la capacidad que se construye para la ascendente. Si la deflación de tokens sigue expandiendo el uso más rápido de lo que erosiona el ingreso por token, la apuesta sale y la expansión se parece a los ferrocarriles que funcionaron. Si el uso se estanca mientras la factura de entrenamiento se compone, el sector habrá construido el otro tipo de ferrocarril. La diferencia entre esos escenarios es la mayor incertidumbre en los mercados tecnológicos hoy, y la marcan las dos curvas de este artículo.
Variables a seguir
Tres cifras llevan la historia adelante. El precio de mercado para igualar cada nuevo modelo de frontera, y el retraso hasta lograrlo, porque ese par determina toda la estructura de márgenes de los productos de IA. El coste de la mayor ejecución de entrenamiento revelada frente a la tendencia de mil millones de Epoch4, porque la primera ejecución pública de mil millones marcará el punto en que la estructura de capital de la IA de frontera se parezca a la aeroespacial. Y la relación entre los ingresos por inferencia del sector y la inversión en entrenamiento, porque ese es el dato que indica si las dos curvas llegarán a encontrarse en un negocio que se compone, o si el hueco se financia, indefinidamente, bajo la creencia de que deben hacerlo. Ambas curvas se han mantenido durante años. Ninguna es una ley de la naturaleza.
Guido Appenzeller, Welcome to LLMflation, Andreessen Horowitz (noviembre de 2024): GPT-3 a 60 dólares por millón de tokens en noviembre de 2021 frente a 0,06 dólares para Llama 3.2 3B en noviembre de 2024; descenso anual de unas 10 veces; mecanismos desde cuantización hasta competencia con pesos abiertos; o1 lanzado a 60 dólares por millón de tokens de salida.
Stanford HAI, AI Index 2025, según los resúmenes de encuestas de precios de inferencia: caída de unas 280 veces para calidad equivalente a GPT-3.5 en unos 18 meses.
Epoch AI, LLM inference prices have fallen rapidly but unequally across tasks: descenso medio de cerca de 50 veces por año en benchmarks, unas 200 veces por año desde enero de 2024, con gran variación según la tarea.
Epoch AI, How much does it cost to train frontier AI models? y Cottier et al., The rising costs of training frontier AI models: costes amortizados de la ejecución final creciendo unas 2,4 veces por año desde 2016; GPT-4 cerca de 40 millones amortizados, 78 millones a precios de nube según Stanford, más de 100 millones según Sam Altman; las ejecuciones más grandes se proyectan por encima de 1.000 millones en 2027.



