En novembre 2021, obtenir un million de tokens de texte généré par GPT-3 coûtait 60 $ via l’API. Trois ans plus tard, un modèle d’au moins cette qualité produit le même million pour 0,06 $1 : une chute d’un facteur mille, soit environ 10 fois par an, plus rapide que la baisse du coût du calcul à l’époque du PC ou que celle de la bande passante lors de la bulle Internet1. L’AI Index de Stanford a mesuré l’effondrement pour la classe GPT-3.5 à 280 fois moins cher en environ dix-huit mois2. Epoch AI, qui suit les prix sur différents benchmarks, constate que la baisse médiane s’accélère à environ 200 fois par an depuis janvier 20243.

Une précision de méthode s’impose d’emblée. Ces baisses de prix s’entendent à capacité équivalente, des modèles comparés dans le temps à niveau de référence égal, et non au prix du modèle de pointe du moment ; elles mélangent aussi tokens d’entrée et de sortie, qualité et latence, prix affichés et prix négociés. La direction et l’ordre de grandeur résistent à tous les ajustements raisonnables ; le multiplicateur précis dépend du niveau de qualité et du panier de tokens que l’on fixe.

Dans le même temps, l’autre prix du secteur a évolué en sens inverse. Le coût amorti de la session finale d’entraînement d’un modèle de pointe a augmenté, selon la tendance estimée par Epoch pour les sessions de pointe, d’environ 2,4 fois par an depuis 20164. L’entraînement de GPT-4 a coûté plusieurs dizaines de millions de dollars : environ 40 millions selon le calcul amorti d’Epoch, 78 millions au prix du cloud, plus de 100 millions selon son fabricant4. Si la tendance se poursuit, les plus grandes sessions dépasseront le milliard de dollars vers 20274. Utiliser l’intelligence s’effondre en prix ; construire sa frontière devient de plus en plus cher.

$60 to $0.06

Prix par million de tokens pour une sortie de type GPT-3, de novembre 2021 à novembre 2024. Les coûts d’entraînement des modèles de pointe ont augmenté de 2,4 fois par an sur la même période.

Andreessen Horowitz ; Epoch AI

Pourquoi le coût d’usage s’est effondré

Aucune astuce unique n’a suffi ; cinq leviers se sont cumulés1. Les générations de GPU se sont succédé. La quantification a réduit l’arithmétique de 16 à 4 bits, soit un facteur quatre à elle seule. Les logiciels d’inférence ont appris à regrouper, mettre en cache et diffuser pour contourner les goulets d’étranglement mémoire. Les techniques post-entraînement ont permis à de petits modèles d’apprendre ce que seuls les géants savaient, si bien que quelques milliards de paramètres surpassent désormais l’original à 175 milliards. Enfin, la publication de modèles open weights par Meta, Mistral et des laboratoires chinois a transformé le service de modèles en une activité de commodité, où une douzaine de fournisseurs se livrent une guerre des prix jusqu’au coût marginal de l’électricité.

Le dernier mécanisme est déterminant pour l’atterrissage des prix. Un modèle propriétaire se positionne face à son meilleur concurrent ; un modèle open weights s’aligne sur la facture cloud de n’importe qui. À chaque fois qu’une capacité de pointe est reproduite en open weights, généralement en un à deux ans, le prix de cette capacité tombe aux marges de commodité, et les laboratoires de pointe doivent soit avancer, soit voir leurs marges s’éroder. Le facteur 280 n’est pas de la générosité. C’est l’effet de la concurrence quand la recette s’échappe.

Janvier 2025 a fourni la démonstration canonique. DeepSeek, un laboratoire chinois, a publié des open weights proches du niveau de pointe, accompagnés d’un article détaillant un budget d’entraînement bien inférieur à ce que le marché pensait nécessaire, et les prix du service ont chuté dans tout le secteur en quelques semaines. Quelle que soit la comptabilité derrière le chiffre annoncé, la leçon de marché s’est imposée : le délai de réplication s’est encore raccourci, et il l’a fait depuis une direction que les contrôles à l’export étaient censés fermer. La déflation des prix dans ce secteur n’est pas qu’une histoire d’efficacité ; c’est aussi une histoire de prolifération.

Pourquoi la frontière devient plus chère

Les coûts d’entraînement augmentent parce que la capacité reste liée à la puissance de calcul, et qu’à la frontière, cette puissance s’achète par datacentres de plusieurs gigawatts et flottes de GPU à six chiffres. Epoch attribue la croissance annuelle de 2,4 fois surtout à la quantité de matériel : des grappes plus grandes, qui tournent plus longtemps sur des puces plus chères4. Le tournant vers les modèles de raisonnement a ajouté une nuance en 2024-2025 : des modèles qui réfléchissent plus longtemps par requête, dont l’amélioration s’achète en partie à l’inférence, ce qui explique pourquoi o1 d’OpenAI a été lancé au même prix de 60 $ le million de tokens de sortie que GPT-3 à son lancement1. Le prix de la frontière réapparaît au sommet de chaque cycle, même quand le plancher s’effondre.

La session à un milliard de dollars a une conséquence que le secteur évoque à voix basse : à ce prix, seules quelques entreprises dotées des plus gros bilans de l’histoire du capitalisme, et les États qui jugent la capacité souveraine, peuvent financer une tentative de pointe. La croissance du coût d’entraînement est un mécanisme de concentration, le même cliquet à l’œuvre dans la fabrication des puces, où chaque génération élimine ceux qui ne peuvent pas payer la suivante.

Vivre dans l’écart

Chaque modèle économique de l’IA est une position sur ces deux courbes. Les entreprises d’application profitent de la courbe descendante : une fonctionnalité non rentable à 20 $ le million de tokens devient négligeable à vingt centimes, ce qui explique le passage rapide des démonstrations aux standards. Le modèle économique des laboratoires doit franchir la courbe montante : les revenus de pointe doivent couvrir l’entraînement de pointe, plus la déflation du produit de l’an dernier en commodité cette année. La phrase la plus redoutée dans une réunion financière de laboratoire n’est pas sur les concurrents : c’est que le produit amorti se déprécie à 10 fois par an.

L’écart explique aussi les équilibres structurels du secteur. Les fabricants de modèles vendent des engagements de calcul aux clouds et prennent des parts dans leur capital, car la facture d’entraînement nécessite un partenaire de bilan ; les clouds acceptent, car l’inférence à prix de commodité continue de vendre de l’électricité et des racks en volume. Pendant ce temps, les acheteurs de capacités d’IA bénéficient d’une bonne affaire qui s’améliore sans cesse, avec une réserve : la tranche bon marché a toujours une génération de retard sur la plus chère, et la valeur de cet écart (quelques mois d’avance technologique, facturés des centaines de fois le prix de la commodité) est le véritable produit vendu par les laboratoires de pointe.

Les deux courbes, en chiffres

Mesure

Valeur

Sortie de type GPT-3, nov. 2021

$60 par million de tokens

Même qualité, nov. 2024

$0,06 par million de tokens

Baisse pour la classe GPT-3.5

280 fois en environ 18 mois

Baisse médiane du prix depuis janv. 2024

Environ 200 fois par an

Croissance du coût d’entraînement de pointe

2,4 fois par an depuis 2016

Plus grandes sessions, selon la tendance

Plus d’1 milliard de dollars d’ici 2027

Andreessen Horowitz ; Stanford AI Index ; Epoch AI

La clause de Jevons

Toute technologie qui devient radicalement moins chère vérifie la même observation du XIXe siècle : l’efficacité accroît la consommation. Les moteurs économes en charbon en ont brûlé davantage au total ; des lumens bon marché ont éclairé la nuit ; et des tokens à un dix-millième de leur prix de 2021 sont dépensés dix mille fois plus, dans des agents qui lisent des bases de code entières, des chaînes qui rédigent et réécrivent, des produits qui appellent un modèle là où ils interrogeaient une base de données. La déflation ne réduit pas le chiffre d’affaires du secteur : elle permet son extension à des tâches qui ne valaient pas 60 $ le million de tokens et valent évidemment six centimes. La baisse du prix est le modèle économique.

Pour les acheteurs, les règles pratiques en découlent directement. Ne signez jamais d’engagements longs au prix par token d’aujourd’hui pour les volumes de demain. Concevez vos systèmes pour pouvoir changer de modèle sous-jacent, car le modèle adéquat le moins cher change chaque trimestre. Et considérez la tranche premium comme une option sur l’avance de capacité, non comme un abonnement à l’intelligence, à renouveler seulement tant que cette avance existe pour votre usage. Les services achats qui ont appris la dépréciation du matériel sur des décennies la réapprennent à la vitesse du logiciel.

Ce que la déflation ne fait pas disparaître

La baisse du prix du token masque le déplacement de la facture, non sa disparition. La dépense totale d’inférence augmente même si le coût unitaire s’effondre, car l’usage croît plus vite que les prix ne baissent ; le déploiement de datacentres est financé sur ce calcul précis. Et les charges de raisonnement compliquent à nouveau l’économie unitaire : une requête qui consomme dix mille tokens de réflexion à bas prix peut coûter plus cher qu’une autre qui en brûlait cent à prix élevé. Des tokens bon marché ne garantissent pas des réponses bon marché ; ils garantissent que des réponses coûteuses achètent plus de réflexion.

La déflation n’atteint pas non plus toutes les tâches de la même façon. Les données d’Epoch montrent les baisses les plus rapides là où les benchmarks sont saturés et où des alternatives open weights existent, et des baisses bien plus lentes à la frontière des capacités3. Les prix dessinent la carte de la concurrence, et la concurrence celle du délai de réplication. Quand le délai est court, les tokens tendent vers la gratuité ; quand un seul laboratoire détient la capacité, il conserve son pouvoir de fixation, tant que son avance dure, ce que l’histoire récente suggère se compter en trimestres, non en années.

La conséquence macroéconomique vaut d’être énoncée : les deux courbes se financent mutuellement. Les centaines de milliards investis dans les datacentres sont un pari que la demande d’inférence, portée par la courbe descendante, remplira la capacité construite pour la courbe montante. Si la déflation des tokens continue de faire croître l’usage plus vite qu’elle n’érode le revenu par token, le pari est gagnant et le déploiement ressemble aux chemins de fer qui ont réussi. Si l’usage plafonne alors que la facture d’entraînement explose, le secteur aura construit l’autre type de chemin de fer. L’écart entre ces deux scénarios est la plus grande incertitude des marchés technologiques aujourd’hui, et il est déterminé par les deux courbes de prix présentées ici.

Variables à suivre

Trois chiffres portent la suite. Le prix de marché pour égaler chaque nouveau modèle de pointe, et le délai avant qu’il soit atteint, car ce couple détermine la structure de marge de chaque produit d’IA. Le coût de la plus grande session d’entraînement rendue publique face à la tendance du milliard de dollars d’Epoch4, car la première session publique à un milliard marquera le moment où la structure de capital de l’IA de pointe ressemblera à celle de l’aéronautique. Et le ratio entre les revenus d’inférence du secteur et les investissements d’entraînement, car c’est ce chiffre qui dira si les deux courbes se rejoignent un jour dans un secteur qui croît, ou si l’écart est financé indéfiniment sur la croyance qu’elles doivent converger. Les deux courbes tiennent depuis des années. Aucune n’est une loi de la nature.

  1. Guido Appenzeller, Welcome to LLMflation, Andreessen Horowitz (novembre 2024) : GPT-3 à 60 $ le million de tokens en novembre 2021 contre 0,06 $ pour Llama 3.2 3B en novembre 2024 ; baisse annuelle d’environ 10 fois ; mécanismes de la quantification à la concurrence open weights ; o1 lancé à 60 $ le million de tokens de sortie.

  2. Stanford HAI, AI Index 2025 : d’après les enquêtes sur les prix d’inférence, baisse d’environ 280 fois pour une qualité équivalente à GPT-3.5 en environ 18 mois.

  3. Epoch AI, LLM inference prices have fallen rapidly but unequally across tasks : baisse médiane proche de 50 fois par an sur les benchmarks, environ 200 fois par an depuis janvier 2024, avec de fortes variations selon la tâche.

  4. Epoch AI, How much does it cost to train frontier AI models? et Cottier et al., The rising costs of training frontier AI models : coûts amortis de session finale en hausse d’environ 2,4 fois par an depuis 2016 ; GPT-4 près de 40 millions amortis, 78 millions au prix du cloud selon Stanford, plus de 100 millions selon Sam Altman ; plus grandes sessions projetées au-delà d’1 milliard de dollars d’ici 2027.