Chers lecteurs, vous souvenez-vous de l’époque où l’IA générative ne faisait que créer des images amusantes de chats ? Juillet 2026 nous rappelle que cette époque est révolue depuis longtemps. Nous vivons actuellement dans un rêve fiévreux où se mêlent communication vocale bidirectionnelle, agents autonomes infiltrant Wall Street et géants de la technologie se disputant la propriété de la “ boucle cognitive ”.”
Que vous soyez un directeur technique cherchant à cartographier votre infrastructure ou simplement quelqu’un qui se demande pourquoi votre téléphone traduit soudainement 70 langues en temps réel, nous vous proposons une analyse complète des raisons pour lesquelles l’ère des “ chatbots superficiels ” vient de toucher le fond.

Podcast « GenAI & Agentic News »

Actualités économiques et analyses de marché

Nouveaux modèles et innovations

Réflexions de Victor Coimbra

En 2026, la plupart des directeurs techniques (CTO) élaborent leur stratégie en matière d’IA uniquement au niveau de la surface visible – en achetant des licences Copilot et des licences de chatbot –, alors que le véritable travail stratégique se situe dans les couches plus profondes et moins visibles de la pile technologique. Le cadre de référence décrit une entreprise « native IA » comme étant composée de quatre couches :

1) Demande – là où les humains et l’IA se rencontrent (chatbots, copilotes, agents). Facile à acquérir et à budgétiser, mais difficile de se démarquer, car tous les concurrents s’approvisionnent auprès des mêmes fournisseurs.

2) Plateforme d'IA – ce que l’IA sait et est capable de faire (prompts, bibliothèques de compétences, recherche/RAG, protocoles de connexion, mémoire persistante). C’est ce qui transforme un chatbot en un agent qui intervient au sein de l’entreprise.

3) Infrastructure LLM – la manière dont les modèles sont acheminés, gérés et optimisés en termes de coûts (modèles de pointe, modèles de petite taille/affinés, modèles spécialisés et modèles en périphérie).

4) Matériel – où les modèles s'exécutent physiquement et qui contrôle cette puissance de calcul (hyper-scalers, infrastructure privée de 1 TP à 37 T, sur site, puces sur mesure).
Trois pressions poussent les directeurs techniques à rester dans l'ombre : pression de la plate-forme (la couche « plateforme » est désormais indispensable, et non plus facultative, pour toute personne passant de la phase pilote à la phase de déploiement des agents), pression sur les coûts (les subventions accordées par Frontier Inference arrivent à leur terme – Uber aurait épuisé l'intégralité de son budget 2026 consacré aux modèles de langage (LLM) en quatre mois), et pression en matière de souveraineté (Le programme de résidence data, la loi européenne sur l’IA et la géopolitique font de l’équipement informatique un enjeu au niveau du conseil d’administration, notamment parce que les infrastructures d’IA exécutent des processus intelligents qui prennent des décisions, et ne se limitent pas à une simple puissance de calcul standard).

Couverture des battements de séquençage C'est là la recommandation principale. L'argument n'est pas que chaque entreprise doive contrôler toutes les couches : certaines positions solides résultent justement du fait de s'appuyer délibérément sur les abstractions des hyperscalers et de concentrer les investissements ailleurs.
Ce qui importe, c'est que le choix soit délibéré plutôt que par défaut. L’ordre approprié dépend du profil de l’entreprise : les start-ups et les petites structures se concentrent sur les applications et la plateforme ; les multinationales (biens de grande consommation, industrie pharmaceutique, secteur juridique, santé) s’étendent vers la plateforme ; les secteurs à haut degré de maturité (finance, télécommunications, entreprises natives du numérique) prennent déjà des décisions en matière d’infrastructure ; enfin, les géants technologiques, les pouvoirs publics et l’industrie manufacturière spécialisée font de véritables choix en matière de matériel.

Il s'agit d'un modèle replay de la Transition cloud – la question posée en 2012 “ AWS ou pas ? ”, qui a débouché en 2018 sur un choix d’architecture à plusieurs niveaux – mais dans un délai condensé de trois à quatre ans, et non pas sur une décennie.
Les trois mesures recommandées aux directeurs techniques cette année : Attribuez explicitement la responsabilité de la couche “ AI Platform ” (le contexte étant la partie de la pile dont le coût ne diminue pas), inscrivez les aspects économiques de l’inférence à l’ordre du jour des réunions trimestrielles (routage, modèles plus légers, voire exploration de l’entraînement en interne), et réexaminez délibérément les choix en matière de matériel et d’infrastructure, même si la réponse reste « un hyperscaler pour l’instant ». La distinction finale : les directeurs techniques qui s’arrêtent à la couche visible finissent par gérer des outils ; ceux qui regardent sous la surface finissent par gérer la capacité cognitive – le choix étant de savoir si l’on souhaite être un directeur technique opérationnel ou stratégique.