	{"id":1402297,"date":"2026-08-10T16:38:17","date_gmt":"2026-08-10T15:38:17","guid":{"rendered":"https:\/\/www.artefact.com\/?post_type=blog&#038;p=1402297"},"modified":"2026-08-10T16:39:14","modified_gmt":"2026-08-10T15:39:14","slug":"measuring-agentic-ai-in-production-the-new-evaluation-discipline-for-autonomous-systems","status":"publish","type":"blog","link":"https:\/\/www.artefact.com\/fr\/blog\/measuring-agentic-ai-in-production-the-new-evaluation-discipline-for-autonomous-systems\/","title":{"rendered":"\u00c9valuation de l'IA agentique en environnement de production : la nouvelle discipline d'\u00e9valuation des syst\u00e8mes autonomes"},"content":{"rendered":"<h2>Introduction<\/h2>\n<p>Un client avec lequel nous avons collabor\u00e9 l'ann\u00e9e derni\u00e8re a d\u00e9velopp\u00e9 un agent d'IA d\u00e9di\u00e9 aux demandes d'achat. Celui-ci analysait les documents des fournisseurs, comparait les tarifs, signalait les risques de non-conformit\u00e9 et formulait des recommandations. Il fonctionnait bien. Mais quelques mois apr\u00e8s sa mise en service, l'\u00e9quipe s'est heurt\u00e9e \u00e0 une question \u00e0 laquelle elle ne savait pas vraiment r\u00e9pondre : comment \u00e9valuer si les r\u00e9sultats sont toujours de bonne qualit\u00e9 ?<\/p>\n<p>Ils effectuaient des contr\u00f4les ponctuels manuels sur quelques dossiers par semaine. Les alertes de conformit\u00e9 se d\u00e9clenchaient pour certaines demandes, mais pas pour d\u2019autres qui semblaient similaires. Les comparaisons de prix \u00e9taient g\u00e9n\u00e9ralement exactes, mais pr\u00e9sentaient parfois des \u00e9carts significatifs. L\u2019agent apportait une valeur ajout\u00e9e, mais l\u2019\u00e9quipe ne disposait d\u2019aucun moyen syst\u00e9matique pour quantifier cette valeur, ni pour d\u00e9terminer si la qualit\u00e9 s\u2019am\u00e9liorait ou se d\u00e9t\u00e9riorait.<\/p>\n<p>Il s'agit l\u00e0 d'une \u00e9tape famili\u00e8re dans le processus d'adoption de l'IA agentique. Le syst\u00e8me fonctionne suffisamment bien pour des t\u00e2ches concr\u00e8tes, et l'organisation est pr\u00eate \u00e0 passer de \u201c cela fonctionne \u201d \u00e0 \u201c nous pouvons prouver que cela fonctionne \u201d. Cette transition n\u00e9cessite un type d'\u00e9valuation diff\u00e9rent de celui auquel la plupart des \u00e9quipes sont habitu\u00e9es, et il s'agit l\u00e0 de l'une des capacit\u00e9s les plus importantes que les organisations sont en train de d\u00e9velopper actuellement.<\/p>\n<h2>Pourquoi les agents ont besoin de leur propre m\u00e9thode d'\u00e9valuation<\/h2>\n<p>L'apprentissage automatique traditionnel disposait d'indicateurs clairs : pr\u00e9cision, rappel, AUC. M\u00eame les premi\u00e8res IA g\u00e9n\u00e9ratives pouvaient s'appuyer sur des \u00e9valuations de pr\u00e9f\u00e9rences humaines et sur des ensembles de r\u00e9f\u00e9rence data. Les agents sont suffisamment diff\u00e9rents pour que ces approches ne soient pas directement transposables.<\/p>\n<p>La raison principale tient au fait que les agents op\u00e8rent \u00e0 travers plusieurs \u00e9tapes. Ils prennent des d\u00e9cisions de branchement, font appel \u00e0 des outils, g\u00e8rent les erreurs et produisent des r\u00e9sultats qui d\u00e9pendent du chemin qu\u2019ils ont emprunt\u00e9. Si vous ex\u00e9cutez deux fois le m\u00eame agent avec la m\u00eame entr\u00e9e, vous pouvez obtenir des s\u00e9quences d\u2019appel d\u2019outils diff\u00e9rentes, des raisonnements interm\u00e9diaires diff\u00e9rents et des r\u00e9sultats finaux diff\u00e9rents \u2013 qui peuvent tous \u00eatre parfaitement valables. Un agent qui r\u00e9sout un probl\u00e8me en suivant une s\u00e9quence d\u2019\u00e9tapes diff\u00e9rente de celle attendue n\u2019a pas tort. Il se peut m\u00eame que ce soit mieux ainsi.<\/p>\n<p>Cela signifie que l'\u00e9valuation doit \u00e9voluer. Chez Artefact, nous travaillons sur des approches concr\u00e8tes \u00e0 cet \u00e9gard dans le cadre de nos interventions ax\u00e9es sur l'agent, et un ensemble clair de mod\u00e8les se dessine, qui donne de bons r\u00e9sultats en production.<\/p>\n<h2>En quoi l'\u00e9valuation des agents est-elle diff\u00e9rente ?<\/h2>\n<p>Trois \u00e9l\u00e9ments distinguent l'\u00e9valuation des agents de celle des mod\u00e8les.<\/p>\n<p>Le premier est <strong>non-d\u00e9terminisme<\/strong>. En apprentissage automatique classique, vous \u00e9valuez un mod\u00e8le par rapport \u00e0 un ensemble de test et obtenez un r\u00e9sultat stable. Avec les agents, le r\u00e9sultat d\u00e9pend d\u2019une cha\u00eene d\u2019appels de LLM, d\u2019invocations d\u2019outils et de d\u00e9cisions de branchement. Affirmer que \u201c l\u2019agent doit appeler la fonction X avant la fonction Y \u201d ne fonctionne pas lorsqu\u2019il existe plusieurs ordres valides. L\u2019\u00e9valuation doit tenir compte des diff\u00e9rents chemins corrects menant au m\u00eame r\u00e9sultat.<\/p>\n<p>Le second est <strong>d\u00e9pendance vis-\u00e0-vis du cheminement<\/strong>. La r\u00e9ponse finale d\u2019un agent r\u00e9sulte d\u2019une cha\u00eene de d\u00e9cisions, chacune influen\u00e7ant la suivante. Deux agents peuvent aboutir au m\u00eame r\u00e9sultat correct, mais l\u2019un d\u2019eux s\u2019est remis d\u2019une d\u00e9faillance de l\u2019outil survenue en cours de route, tandis que l\u2019autre a simplement r\u00e9ussi \u00e0 l\u2019\u00e9viter. Se concentrer uniquement sur le r\u00e9sultat final ne permet pas de saisir cette diff\u00e9rence. Comprendre le cheminement du raisonnement vous offre une vision bien plus compl\u00e8te de la robustesse du syst\u00e8me.<\/p>\n<p>Le troisi\u00e8me est <strong>correction d\u00e9pendante du contexte<\/strong>. Dans de nombreux cas de figure en entreprise, la qualit\u00e9 s'inscrit dans un continuum. Un responsable des achats qui n\u00e9gocie une remise de 12% fait du bon travail.<\/p>\n<p>Une solution qui permet de n\u00e9gocier 15% est pr\u00e9f\u00e9rable. Une solution qui permet de n\u00e9gocier 10% tout en pr\u00e9servant une relation cruciale avec un fournisseur pourrait bien \u00eatre la meilleure de toutes. Une \u00e9valuation pertinente doit tenir compte du contexte commercial, et pas seulement du fait que le r\u00e9sultat soit juste ou faux.<\/p>\n<h2>Des approches qui ont fait leurs preuves en production<\/h2>\n<p>Certaines approches donnent d\u00e9j\u00e0 de bons r\u00e9sultats, et leur point commun r\u00e9side dans le fait de consid\u00e9rer les agents davantage comme des syst\u00e8mes que comme des mod\u00e8les.<\/p>\n<p><strong>\u00c9valuation au niveau des trajectoires<\/strong> C'est sans doute le changement le plus significatif. Plut\u00f4t que de noter uniquement le r\u00e9sultat final, les \u00e9quipes \u00e9valuent l'ensemble de la s\u00e9quence d'actions de l'agent. L'agent a-t-il identifi\u00e9 les bonnes sous-t\u00e2ches ? A-t-il utilis\u00e9 les outils appropri\u00e9s ? A-t-il su se remettre de ses erreurs ? A-t-il fait remonter le probl\u00e8me lorsqu\u2019il le fallait ? Cela n\u00e9cessite une journalisation structur\u00e9e de chaque \u00e9tape effectu\u00e9e par l\u2019agent, ainsi que des grilles d\u2019\u00e9valuation permettant de noter le parcours dans son ensemble. Cela offre aux \u00e9quipes une vision bien plus compl\u00e8te de la qualit\u00e9 de l\u2019agent que le simple examen des r\u00e9sultats finaux.<\/p>\n<p><strong>LLM en tant que juge avec des grilles d'\u00e9valuation calibr\u00e9es<\/strong> a \u00e9galement \u00e9volu\u00e9 rapidement. Le recours \u00e0 un LLM distinct pour \u00e9valuer les r\u00e9sultats des agents devient la norme, et la cl\u00e9 pour garantir la fiabilit\u00e9 de ce processus r\u00e9side dans la grille d'\u00e9valuation. D\u00e9finissez des crit\u00e8res explicites, fournissez des exemples class\u00e9s par niveau de qualit\u00e9 (bonnes et mauvaises performances) et calibrez r\u00e9guli\u00e8rement le syst\u00e8me d'\u00e9valuation en fonction des \u00e9valuations humaines. Les \u00e9quipes qui parviennent \u00e0 \u00e9tablir une grille d'\u00e9valuation pertinente constatent une forte corr\u00e9lation avec le jugement humain.<\/p>\n<p><strong>Tests bas\u00e9s sur des sc\u00e9narios<\/strong> Il existe une autre approche qui s'av\u00e8re tr\u00e8s efficace. Les \u00e9quipes les plus performantes avec lesquelles je travaille disposent de biblioth\u00e8ques comprenant entre 50 et 200 sc\u00e9narios couvrant les cas de fonctionnement normal, les cas limites, les entr\u00e9es malveillantes et les modes de d\u00e9faillance connus. Ces biblioth\u00e8ques s'enrichissent \u00e0 chaque incident de production et deviennent l'un des atouts les plus pr\u00e9cieux d'un programme d'IA agentique.<\/p>\n<p>Et <strong>\u00e9valuation continue en production<\/strong> C'est ce qui permet de tout relier. Les tests pr\u00e9alables au d\u00e9ploiement vous apportent de la confiance au moment du lancement. L'\u00e9valuation continue vous apporte de la confiance au quotidien par la suite. En pr\u00e9levant des \u00e9chantillons d'interactions en production, en les soumettant \u00e0 des pipelines d'\u00e9valuation et en suivant les indicateurs de qualit\u00e9 au fil du temps, les \u00e9quipes peuvent am\u00e9liorer les agents de mani\u00e8re syst\u00e9matique plut\u00f4t que de mani\u00e8re r\u00e9active.<\/p>\n<blockquote><p><em>\u201c L'\u00e9valuation n'est pas une d\u00e9marche que l'on effectue avant le lancement pour ensuite passer \u00e0 autre chose. Il s'agit d'une pratique continue, et ce sont les \u00e9quipes qui l'envisagent ainsi qui lancent leurs produits en toute confiance. \u201d<\/em> \u2013 Abhishek Singh, directeur scientifique de Data, Artefact<\/p><\/blockquote>\n<h2>D\u00e9finir le bon mod\u00e8le de propri\u00e9t\u00e9<\/h2>\n<p>Il y a un aspect organisationnel \u00e0 cet \u00e9gard qui m\u00e9rite d'\u00eatre abord\u00e9.<\/p>\n<p>Dans le domaine de l'apprentissage automatique traditionnel, le chercheur \u00ab data \u00bb qui a d\u00e9velopp\u00e9 le mod\u00e8le \u00e9tait g\u00e9n\u00e9ralement responsable de son \u00e9valuation. Dans les syst\u00e8mes bas\u00e9s sur des agents, le champ d'action est plus large. L'agent intervient dans plusieurs processus m\u00e9tier, fait appel \u00e0 des outils g\u00e9r\u00e9s par diff\u00e9rentes \u00e9quipes et produit des r\u00e9sultats qui ont un impact sur les parties prenantes de l'ensemble de l'organisation. Les mod\u00e8les de responsabilit\u00e9 en mati\u00e8re d\u2019\u00e9valuation des agents sont encore en cours d\u2019\u00e9laboration dans l\u2019ensemble du secteur, et il est essentiel de bien d\u00e9finir ces aspects d\u00e8s le d\u00e9but pour faire la diff\u00e9rence.<\/p>\n<p>Les \u00e9quipes qui y parviennent d\u00e9signent clairement un responsable de l'\u00e9valuation : il ne s'agit pas n\u00e9cessairement d'une \u00e9quipe d\u00e9di\u00e9e, mais d'une personne ou d'un service charg\u00e9 de d\u00e9finir les normes de qualit\u00e9, de mettre en place l'infrastructure d'\u00e9valuation et de veiller \u00e0 ce que le d\u00e9veloppement r\u00e9ponde \u00e0 des crit\u00e8res mesurables. Le fait de pr\u00e9ciser d\u00e8s le d\u00e9part qui en est responsable permet d'\u00e9viter que chacun ne parte du principe que quelqu'un d'autre s'en charge.<\/p>\n<h2>Recommandations pratiques<\/h2>\n<p>Au vu de ce que nous avons pu observer au cours de nos diff\u00e9rentes missions, voici ce que je recommanderais aux \u00e9quipes qui investissent dans l'IA agentique.<\/p>\n<p>Commencez par d\u00e9finir le cadre d'\u00e9valuation, et non par l'agent lui-m\u00eame. Avant d'\u00e9crire le code de l'agent, d\u00e9finissez ce que vous consid\u00e9rez comme une r\u00e9ussite. Quels sont les r\u00e9sultats mesurables ? \u00c0 quoi ressemble une bonne trajectoire ? Quels modes de d\u00e9faillance souhaitez-vous d\u00e9tecter d\u00e8s le d\u00e9but ? Ce travail en amont permet d'\u00e9viter la situation courante o\u00f9 les \u00e9quipes d\u00e9veloppent un agent performant, puis passent des mois \u00e0 chercher comment le valider.<\/p>\n<p>Misez d\u00e8s le d\u00e9part sur la journalisation structur\u00e9e. Chaque appel d'outil, chaque point de d\u00e9cision, chaque interaction avec un mod\u00e8le de langage de grande envergure (LLM) doit \u00eatre consign\u00e9 dans un format structur\u00e9 et consultable. Sans cela, vous ne pouvez qu'\u00e9valuer les r\u00e9sultats sans comprendre comment l'agent y est parvenu. Mettre en place l'observabilit\u00e9 a posteriori co\u00fbte plus cher que de l'int\u00e9grer d\u00e8s le d\u00e9part.<\/p>\n<p>Constituez une biblioth\u00e8que de sc\u00e9narios et consid\u00e9rez-la comme une ressource \u00e0 part enti\u00e8re. G\u00e9rez-en les versions, revoyez-la et enrichissez-la \u00e0 chaque incident de production.<\/p>\n<p>Pr\u00e9voyez une \u00e9valuation continue d\u00e8s le d\u00e9but. Et d\u00e9signez d\u00e8s le d\u00e9part un responsable de l'\u00e9valuation clairement identifi\u00e9 : les \u00e9quipes qui passent le plus rapidement de la phase pilote \u00e0 la mise en production sont celles au sein desquelles une personne est explicitement charg\u00e9e de veiller \u00e0 la qualit\u00e9 des agents.<\/p>\n<h2>Notre approche chez Artefact<\/h2>\n<p>Chez Artefact, l'\u00e9valuation fait partie int\u00e9grante de notre m\u00e9thodologie \u00ab AI Factory \u00bb en tant qu'axe de travail central. Chaque projet d'agent comprend une phase de conception d'un cadre d'\u00e9valuation qui se d\u00e9roule en parall\u00e8le du d\u00e9veloppement de l'agent. Nous d\u00e9finissons des grilles d'\u00e9valuation au niveau des trajectoires, constituons des biblioth\u00e8ques de sc\u00e9narios adapt\u00e9es au cas d'utilisation et mettons en place un suivi continu avant la mise en service de l'agent.<\/p>\n<p>Le raisonnement qui sous-tend cette approche est simple : un agent que l'on peut \u00e9valuer est un agent auquel on peut faire confiance, que l'on peut am\u00e9liorer et dont on peut faire \u00e9voluer la capacit\u00e9. Les organisations avec lesquelles nous travaillons et qui adoptent cette approche d\u00e8s le d\u00e9but parviennent syst\u00e9matiquement \u00e0 passer en production plus rapidement et en suscitant davantage de confiance de la part des parties prenantes.<\/p>\n<h2>L'\u00e9valuation comme avantage concurrentiel<\/h2>\n<p>L'IA agentique \u00e9volue rapidement. Les frameworks s'am\u00e9liorent, les mod\u00e8les sont plus performants et les cas d'utilisation sont concrets. Les m\u00e9thodes d'\u00e9valuation rattrapent leur retard, et les organisations qui investissent d\u00e8s maintenant dans ce domaine se forgent un v\u00e9ritable avantage concurrentiel.<\/p>\n<p>Lorsqu\u2019elle est men\u00e9e \u00e0 bien, l\u2019\u00e9valuation vous permet de d\u00e9ployer des agents en toute confiance, de les am\u00e9liorer au fil du temps et de pr\u00e9senter aux parties prenantes des preuves concr\u00e8tes plut\u00f4t que de simples d\u00e9monstrations. Cette discipline est relativement r\u00e9cente, mais les approches sont de mieux en mieux comprises, et les \u00e9quipes qui les adopteront d\u00e8s maintenant seront bien plac\u00e9es lorsque l\u2019IA agentique fera partie int\u00e9grante du fonctionnement des entreprises.<\/p>","protected":false},"excerpt":{"rendered":"<p>Un client avec lequel nous avons collabor\u00e9 l'ann\u00e9e derni\u00e8re a d\u00e9velopp\u00e9 un agent d'IA d\u00e9di\u00e9 aux demandes d'achat. Celui-ci analysait les documents des fournisseurs, comparait les tarifs, signalait les risques de non-conformit\u00e9 et formulait des recommandations. Il fonctionnait bien. Mais quelques mois apr\u00e8s sa mise en service, l'\u00e9quipe s'est heurt\u00e9e \u00e0 une question \u00e0 laquelle elle ne savait pas vraiment r\u00e9pondre : comment \u00e9valuer si les r\u00e9sultats sont toujours de bonne qualit\u00e9 ?<\/p>","protected":false},"featured_media":1402298,"parent":0,"template":"","meta":{"_acf_changed":false,"ep_exclude_from_search":false},"blog-category":[2995],"blog-language":[2991],"class_list":["post-1402297","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-ai-technology","blog-language-en"],"acf":[],"_links":{"self":[{"href":"https:\/\/www.artefact.com\/fr\/wp-json\/wp\/v2\/blog\/1402297","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.artefact.com\/fr\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/www.artefact.com\/fr\/wp-json\/wp\/v2\/types\/blog"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.artefact.com\/fr\/wp-json\/wp\/v2\/media\/1402298"}],"wp:attachment":[{"href":"https:\/\/www.artefact.com\/fr\/wp-json\/wp\/v2\/media?parent=1402297"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/www.artefact.com\/fr\/wp-json\/wp\/v2\/blog-category?post=1402297"},{"taxonomy":"blog-language","embeddable":true,"href":"https:\/\/www.artefact.com\/fr\/wp-json\/wp\/v2\/blog-language?post=1402297"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}