Au cours des deux dernières années, la question centrale dans le domaine de l'IA était simple : Quel est le modèle le plus intelligent ? Cette question perd de son importance. La couche des modèles se banalise plus rapidement que prévu : les écarts de performances, qui prenaient autrefois un an à combler, se réduisent désormais en l’espace d’un trimestre — souvent grâce à des avancées techniques indépendantes du modèle lui-même. Une nouvelle variable vient donc s’ajouter à la matrice décisionnelle en matière d’IA : Combien coûte un jeton ?
Le « token » a largement dépassé sa définition technique d'unité plus petite qu'un mot.
- À un agent, un jeton constitue l'unité de travail fondamentale.
- À l'attention d'un directeur financier, un jeton constitue une charge d'exploitation émergente.
- Au marché, un jeton se comporte de plus en plus comme une marchandise négociable, avec différents fournisseurs, prix, mécanismes de routage et même des instruments financiers émergents.
Notre thèse principale est simple : L'économie des jetons est, fondamentalement, une économie énergétique dissimulée sous une interface logicielle.. À mesure que les capacités des modèles se rapprochent, la capacité à générer et à distribuer des jetons fiables à un coût moindre et plus prévisible deviendra une source d'avantage concurrentiel de plus en plus importante.
Les agents ont bouleversé les règles économiques de l'IA
Les interfaces de chat traditionnelles ont imposé une limite naturelle à l'utilisation de l'IA : les êtres humains sont lents. Un utilisateur pose une question, attend une réponse, la lit, puis formule la question suivante. L’interaction humaine consiste donc à agit comme un limiteur de la consommation de jetons.
Les agents retirent ce limiteur de vitesse. Un agent de codage peut planifier une tâche, inspecter des fichiers, lancer des outils, exécuter des commandes, évaluer les résultats, corriger les erreurs et répéter le processus. Chaque itération peut enrichir le contexte renvoyé au modèle. Selon les estimations du secteur, les charges de travail des agents s'élèvent généralement à Une consommation de jetons 10 à 50 fois supérieure à celle des interactions traditionnelles à tour unique, selon la tâche.
Cela modifie la dynamique économique de l'IA. À mesure que l'adoption des agents se généralise, la consommation de jetons dépend de moins en moins de l'utilisation par les humains et de plus en plus de exécution en machine. Le marché réagit déjà : l'utilisation intensive a contraint des produits d'IA tels que Cursor et Claude Code à repenser leurs modèles d'abonnement forfaitaire, la mise en place de limites d'utilisation ou de frais supplémentaires lorsqu'un petit nombre d'utilisateurs consomme une quantité disproportionnée de ressources de calcul.
La réponse logique est la suivante : routage multimodèle. Toutes les étapes du flux de travail d’un agent ne nécessitent pas un modèle de pointe. La planification complexe peut être confiée à un modèle haut de gamme, tandis que la recherche, la synthèse, la classification ou l’exécution d’outils courants peuvent être prises en charge par des modèles plus petits et moins coûteux. Des cadres de recherche tels que RouteLLM et FrugalGPT ont démontré que Il est possible de réaliser des réductions de coûts substantielles sans pour autant compromettre les performances de manière proportionnelle.
C'est ici que le harnais d'agent revêt une importance stratégique. Le « harness » — la couche chargée de la planification, de l'orchestration des outils, de la gestion du contexte, de la récupération après erreur et des intégrations — peut pallier les faiblesses du modèle sous-jacent.
Une ingénierie plus performante peut donc réduire l'écart concret entre les modèles de pointe, coûteux, et les alternatives moins onéreuses.
Les implications sont importantes : l'avantage du modèle en termes d'intelligence s'amenuise, tandis que les aspects économiques de l'inférence prennent de plus en plus d'importance.
La mise en cache met en évidence le coût physique d'un jeton
Le routage ne constitue qu'un aspect de l'optimisation des jetons. Mise en cache des invites présente un autre inconvénient : des calculs redondants.
Les workflows d'agents envoient de manière répétée les mêmes invites système, définitions d'outils et contextes persistants. Au lieu de recalculer ces jetons à chaque fois, les fournisseurs peuvent mettre en cache les états KV sous-jacents et les réutiliser.
Les principaux fournisseurs proposent désormais des réductions substantielles pour les données mises en cache, dans certains cas en approche vers 90%. Le prix exact varie en fonction du modèle et de la durée de conservation en cache, mais le principe économique reste le même : si le calcul a déjà été effectué, sa réutilisation ultérieure coûte nettement moins cher.
Cette distinction est importante car un La réduction de la mémoire cache du 90% n'est pas la même chose que le taux de réussite de la mémoire cache du 90%. Si 90% de jetons sont mis en cache et que les jetons mis en cache ne coûtent que 10% du prix catalogue, le coût moyen correspond à environ 19% du prix d'origine : une économie effective d'environ 80%.
Dans le cadre de la planification financière d'entreprise, ces distinctions ont leur importance. L'économie des jetons ne se résume pas simplement au prix catalogue ; elle concerne le coût unitaire effectif dans des conditions de charge de travail réelles.
La mise en cache met également en évidence un aspect plus profond. Pourquoi un jeton mis en cache est-il moins coûteux ? Parce qu’il nécessite moins de calculs. Moins de calculs signifie moins de cycles GPU. Or, les cycles GPU consomment de l’électricité. En d’autres termes, le prix d'un jeton reflète en fin de compte l'infrastructure physique.
Un jeton est de l'électricité cristallisée
Au niveau de l'infrastructure, le prix d'un jeton tient compte des GPU et de leur amortissement, de la capacité du centre de données data, de la mise en réseau, du refroidissement et, surtout, électricité.
La répartition précise des coûts varie en fonction de l'architecture et de la méthode comptable, mais la tendance est claire : à mesure que l'inférence IA prend de l'ampleur, L'énergie est en train de devenir l'un des principaux freins à la rentabilité de l'intelligence artificielle.
Les chiffres sont déjà significatifs. Une interaction typique avec l'IA ne consomme peut-être qu'une fraction de wattheure, mais multipliée par des centaines de milliards d'interactions et amplifiée par des flux de travail impliquant des raisonnements répétés et des appels d'outils, la consommation totale devient colossale.
L'Agence internationale de l'énergie prévoit que la consommation mondiale d'électricité datacenter devrait avoisiner 950 TWh d'ici 2030, soit près du double des niveaux de 2025.
La géographie revêt donc une importance capitale. Les prix de l'électricité industrielle varient considérablement d'un grand marché de l'IA à l'autre, tandis que la Chine a développé la production d'énergie renouvelable à un rythme extraordinaire et a investi massivement dans les régions occidentales, riches en ressources énergétiques, dans le cadre de sa stratégie “ East Data, West Computing ”.
Les solutions logicielles intelligentes peuvent être déployées à l'échelle mondiale en quelques mois, mais une électricité bon marché et fiable C'est impossible. La mise en place de capacités de production, d'infrastructures de transport et de centres de données nécessite des années d'investissements en capital. À mesure que les capacités des modèles deviennent de plus en plus interchangeables, l'accès à une puissance de calcul abondante et peu coûteuse devient un avantage plus durable.
Les jetons transforment l'énergie en un service négociable à l'échelle mondiale
L'électricité est en soi difficile à exporter au-delà des frontières. Les réseaux électriques restent essentiellement régionaux. Les jetons permettent de résoudre ce problème.
À l'intérieur d'un centre data, l'électricité devient de la puissance de calcul. Le calcul se transforme en jetons. Les jetons peuvent ensuite être transmis instantanément via des API et des réseaux à fibre optique à des utilisateurs partout dans le monde. Le jeton constitue donc une forme de énergie numérisée: l'énergie physique transformée en un service pouvant être distribué à l'échelle mondiale.
Cela contribue à expliquer la compétitivité croissante des modèles d'IA chinois. Selon les estimations du secteur, les coûts d'inférence des principaux modèles chinois peuvent être nettement inférieurs à ceux de leurs équivalents occidentaux, bien que l'écart exact varie en fonction du modèle, du fournisseur et de la charge de travail.
La réaction du marché est de plus en plus manifeste. OpenRouter et d’autres plateformes de routage permettent aux développeurs de comparer les modèles en fonction du prix, de la latence et des performances, et de rediriger le trafic de manière dynamique. Les modèles chinois ont conquis une part importante du trafic routé, tandis que les modèles à pondération ouverte, tels que Qwen et DeepSeek, occupent une place de plus en plus prépondérante au sein des écosystèmes mondiaux de développeurs.
Cela ne signifie pas pour autant que les modèles de pointe occidentaux perdent de leur pertinence. Les modèles haut de gamme continuent de bénéficier d’un pouvoir de fixation des prix pour les raisonnements complexes et à enjeux élevés. Le marché connaît plutôt une bifurcation : les modèles de pointe coûteux sont destinés aux tâches cognitives à forte valeur ajoutée, tandis que les modèles moins onéreux prennent en charge le volume bien plus important des inférences de routine.
La question stratégique ne se résume donc plus simplement à savoir qui dispose du modèle le plus performant. Elle porte de plus en plus sur ”Qui est en mesure de fournir le niveau de renseignements requis au coût unitaire le plus bas tout en garantissant la fiabilité ??”
Les poids ouverts accélèrent la banalisation
Les fournisseurs de modèles chinois ont également adopté une stratégie commerciale différente : poids libres.
DeepSeek, Qwen, GLM, Kimi et d’autres familles de modèles chinois ont mis à disposition, à des degrés divers, des paramètres téléchargeables, souvent sous des licences permissives. En revanche, Les principaux fournisseurs occidentaux restent principalement axés sur des écosystèmes d'API fermés.
Ces deux approches reflètent des modèles économiques différents. Les modèles fermés monétisent des capacités cognitives rares grâce à un accès exclusif. Les modèles « open-weight » utilisent le modèle lui-même comme mécanisme d’adoption, déplaçant ainsi la concurrence en aval vers l’infrastructure d’inférence, les services cloud, les outils de développement, le réglage fin et l’intégration d’entreprise.
La sortie de DeepSeek-R1 en janvier 2025 a marqué un tournant important. À mesure que les poids des modèles hautement performants devenaient de plus en plus accessibles, le modèle de base lui-même a perdu de son caractère exclusif.
Dès lors que les poids du modèle tendent vers un coût marginal de distribution nul, Le champ de bataille concurrentiel se déplace vers l'économie de l'inférence et la couche d'entreprise. C'est là l'essence même de la banalisation : lorsque l'intelligence devient abondante, les ressources rares se réorientent vers d'autres domaines.
L'économie des jetons ressemble de plus en plus à un marché des matières premières
La structure qui se met en place autour des jetons ressemble déjà à celle d'un marché des matières premières bien établi :
- Différenciation des prix: Les coûts d'inférence d'un même modèle peuvent varier considérablement selon le fournisseur, la région et l'infrastructure.
- Routage et arbitrage: Des plateformes telles qu’OpenRouter permettent aux utilisateurs de choisir de manière dynamique parmi différents modèles et fournisseurs en fonction du prix, de la latence et du débit.
- Tarification échelonnée: Les prestataires différencient de plus en plus leurs tarifs en fonction de la priorité, de la rapidité, du traitement par lots et de la capacité garantie.
- Quotas et répartition: Les limites d'utilisation et les niveaux de service pour les entreprises permettent de répartir efficacement les ressources informatiques limitées en fonction de la valeur apportée au client et de sa demande.
- Financiarisation: Les indices émergents et les contrats à terme sur la puissance de calcul laissent entrevoir un avenir dans lequel les entreprises pourraient gérer leur exposition en matière de puissance de calcul de la même manière que d'autres coûts variables de production.
Il en résulte une compression rapide du cycle des matières premières. Le routage, la mise en cache, la substitution de modèles et l'électricité à bas coût apportent tous une réponse au même problème sous-jacent : Comment réduire au minimum le coût de fourniture de renseignements utiles. Et sur les marchés des matières premières, ce sont en fin de compte les résultats par unité qui comptent.
Le point de vue de Artefact : les entreprises doivent gérer leur économie des jetons
Pour les entreprises, l'économie des jetons devrait donc devenir une discipline de gestion, et non plus simplement une question d'infrastructure.
1. Considérez les jetons comme un enjeu FinOps: Le coût de l’IA doit être lié aux résultats commerciaux. Combien de jetons faut-il pour résoudre un ticket d’assistance ? Quel est le coût en jetons d’une pull request automatisée ? Quel est le coût global de l’IA par interaction client ? Sans cette attribution, les entreprises ne peuvent pas distinguer une utilisation productive de l’IA d’un gaspillage.
2. Faire du routage multimodèle un principe architectural: Les modèles de pointe ne devraient pas être utilisés par défaut pour toutes les tâches. Les entreprises devraient adapter de manière dynamique les capacités des modèles à la complexité des tâches, en s'appuyant sur un routage intelligent, la mise en cache et l'observabilité. La valeur durable résidera de plus en plus en dehors du modèle : flux de travail propriétaires, contexte d'entreprise, logique d'orchestration, expertise métier et data de confiance.
3. Évaluez les jetons chinois de manière pragmatique: L'écart croissant entre les coûts des modèles chinois et occidentaux mérite d'être examiné avec attention, en particulier pour les charges de travail à haut volume et à faible sensibilité.
Pour les modèles data sensibles, les modèles à poids variable déployés dans des environnements privés ou souverains peuvent offrir un meilleur contrôle sur la localisation et l’infrastructure des modèles data. Pour les tâches standardisées et à haute fréquence, des points de terminaison API économiques peuvent permettre d’améliorer considérablement la rentabilité unitaire.
4. Intégrez la baisse des coûts des modèles dans vos modèles économiques: Les prix des modèles continueront de baisser. Les marges durables dépendront donc moins de l'accès aux données brutes et davantage de intégration des processus métier, solution propriétaire data, orchestration, expertise métier et confiance des clients.
5. Intégrez l'énergie dans le programme stratégique consacré à l'IA: Pour les entreprises technologiques, les fournisseurs de solutions cloud, les fabricants et les décideurs politiques, l’infrastructure d’IA ne peut plus être dissociée de la stratégie énergétique. Le prochain avantage concurrentiel ne viendra peut-être pas de la possession du modèle le plus performant, mais de la capacité à garantir des ressources de calcul abondantes, résilientes et abordables.
Conclusion : Le passage du « smart » à la « haute qualité/faible coût »
L'axe principal de la concurrence dans le domaine de l'IA n'est plus “ Quel est le modèle le plus intelligent ? ”, mais “Qui est en mesure de créer et de fournir des jetons de haute qualité au moindre coût ?? ”
Étant donné qu’un jeton n’est, en fin de compte, que le résultat concret de la puissance de calcul et de la consommation d’électricité, la carte future de la prédominance de l’IA ne sera pas uniquement dessinée par des laboratoires de recherche d’élite, mais par la répartition de une infrastructure énergétique abondante, peu coûteuse et résiliente.

BLOG





