	{"id":1402297,"date":"2026-08-10T16:38:17","date_gmt":"2026-08-10T15:38:17","guid":{"rendered":"https:\/\/www.artefact.com\/?post_type=blog&#038;p=1402297"},"modified":"2026-08-10T16:39:14","modified_gmt":"2026-08-10T15:39:14","slug":"measuring-agentic-ai-in-production-the-new-evaluation-discipline-for-autonomous-systems","status":"publish","type":"blog","link":"https:\/\/www.artefact.com\/es\/blog\/measuring-agentic-ai-in-production-the-new-evaluation-discipline-for-autonomous-systems\/","title":{"rendered":"La medici\u00f3n de la IA agencial en entornos de producci\u00f3n: la nueva disciplina de evaluaci\u00f3n para los sistemas aut\u00f3nomos"},"content":{"rendered":"<h2>Introducci\u00f3n<\/h2>\n<p>Un cliente con el que colaboramos el a\u00f1o pasado desarroll\u00f3 un agente de inteligencia artificial para las solicitudes de adquisici\u00f3n. Este analizaba los documentos de los proveedores, comparaba precios, se\u00f1alaba riesgos de cumplimiento normativo y elaboraba recomendaciones. Funcionaba bien. Sin embargo, al cabo de un par de meses en producci\u00f3n, el equipo se top\u00f3 con una pregunta para la que no ten\u00eda una respuesta satisfactoria: \u00bfc\u00f3mo medimos si los resultados son consistentemente buenos?<\/p>\n<p>Realizaban comprobaciones puntuales manuales de unos pocos casos a la semana. Las alertas de cumplimiento se activaban en algunas solicitudes, pero no en otras que parec\u00edan similares. Las comparaciones de precios eran, en su mayor\u00eda, precisas, pero en ocasiones presentaban desviaciones significativas. El agente aportaba valor, pero el equipo carec\u00eda de un m\u00e9todo sistem\u00e1tico para cuantificar en qu\u00e9 medida lo hac\u00eda, ni para hacer un seguimiento de si la calidad mejoraba o se deterioraba.<\/p>\n<p>Este es un momento habitual en la adopci\u00f3n de la IA agentiva. El sistema funciona lo suficientemente bien para tareas reales, y la organizaci\u00f3n est\u00e1 preparada para pasar de \u201cfunciona\u201d a \u201cpodemos demostrar que funciona\u201d. Esa transici\u00f3n requiere un tipo de evaluaci\u00f3n diferente al que la mayor\u00eda de los equipos est\u00e1n acostumbrados, y es una de las capacidades m\u00e1s importantes que las organizaciones est\u00e1n desarrollando en estos momentos.<\/p>\n<h2>Por qu\u00e9 los agentes necesitan su propio m\u00e9todo de evaluaci\u00f3n<\/h2>\n<p>El aprendizaje autom\u00e1tico tradicional contaba con m\u00e9tricas claras: precisi\u00f3n, recuperaci\u00f3n y AUC. Incluso las primeras versiones de la IA generativa pod\u00edan basarse en valoraciones de preferencias humanas y en conjuntos de datos de referencia data. Los agentes son lo suficientemente diferentes como para que esos enfoques no sean directamente aplicables.<\/p>\n<p>La raz\u00f3n principal es que los agentes operan a lo largo de m\u00faltiples pasos. Toman decisiones de ramificaci\u00f3n, invocan herramientas, se recuperan de los errores y generan resultados que dependen de la ruta que han seguido. Si ejecuta el mismo agente con la misma entrada dos veces, es posible que obtenga secuencias de invocaci\u00f3n de herramientas diferentes, razonamientos intermedios distintos y resultados finales distintos, todos ellos perfectamente v\u00e1lidos. Un agente que resuelve un problema mediante una secuencia de pasos diferente a la esperada no est\u00e1 equivocado. Es posible que incluso sea mejor.<\/p>\n<p>Esto significa que la evaluaci\u00f3n debe evolucionar. En Artefact, hemos estado trabajando en enfoques pr\u00e1cticos al respecto en todas nuestras iniciativas de agencia, y est\u00e1 surgiendo un conjunto claro de patrones que funciona bien en la pr\u00e1ctica.<\/p>\n<h2>\u00bfEn qu\u00e9 se diferencia la evaluaci\u00f3n de los agentes?<\/h2>\n<p>Hay tres aspectos que diferencian la evaluaci\u00f3n de agentes de la evaluaci\u00f3n de modelos.<\/p>\n<p>La primera es <strong>indeterminismo<\/strong>. En el aprendizaje autom\u00e1tico cl\u00e1sico, se eval\u00faa un modelo con un conjunto de prueba y se obtiene un valor estable. En el caso de los agentes, el resultado depende de una cadena de llamadas a modelos de lenguaje a gran escala (LLM), invocaciones de herramientas y decisiones de ramificaci\u00f3n. Afirmar que \u201cel agente debe llamar a la funci\u00f3n X antes que a la funci\u00f3n Y\u201d no es v\u00e1lido cuando existen m\u00faltiples secuencias v\u00e1lidas. La evaluaci\u00f3n debe tener en cuenta las m\u00faltiples rutas correctas que conducen al mismo resultado.<\/p>\n<p>El segundo es <strong>dependencia de la trayectoria<\/strong>. La respuesta final de un agente es el resultado de una cadena de decisiones, cada una de las cuales influye en la siguiente. Dos agentes pueden generar el mismo resultado correcto, pero uno de ellos se ha recuperado de un fallo de una herramienta que se ha producido en el proceso, mientras que el otro simplemente lo ha evitado. Si solo se tiene en cuenta el resultado final, se pasa por alto esa diferencia. Comprender la cadena de razonamiento le ofrece una visi\u00f3n mucho m\u00e1s completa de la robustez del sistema.<\/p>\n<p>El tercero es <strong>correcci\u00f3n dependiente del contexto<\/strong>. En muchos casos de uso empresarial, la calidad se sit\u00faa en un espectro. Un agente de compras que negocia un descuento de 12% hace un buen trabajo.<\/p>\n<p>Es preferible optar por una opci\u00f3n que permita negociar 15%. Sin embargo, una opci\u00f3n que permita negociar 10% pero que preserve una relaci\u00f3n clave con un proveedor podr\u00eda ser la mejor de todas. Una evaluaci\u00f3n \u00fatil debe tener en cuenta el contexto empresarial, y no limitarse \u00fanicamente a si el resultado es correcto o incorrecto.<\/p>\n<h2>Enfoques que est\u00e1n dando buenos resultados en el entorno de producci\u00f3n<\/h2>\n<p>Algunos enfoques ya est\u00e1n dando buenos resultados, y el denominador com\u00fan es tratar a los agentes m\u00e1s como sistemas que como modelos.<\/p>\n<p><strong>Evaluaci\u00f3n a nivel de trayectoria<\/strong> Probablemente sea el cambio m\u00e1s significativo. En lugar de evaluar \u00fanicamente el resultado final, los equipos analizan la secuencia completa de las acciones del agente. \u00bfIdentific\u00f3 el agente las subtareas correctas? \u00bfUtiliz\u00f3 las herramientas adecuadas? \u00bfSe recuper\u00f3 de los errores? \u00bfEscal\u00f3 el problema cuando deb\u00eda hacerlo? Esto requiere un registro estructurado de cada paso del agente y unas r\u00fabricas que eval\u00faen la trayectoria en su conjunto. De este modo, los equipos obtienen una visi\u00f3n mucho m\u00e1s completa de la calidad del agente que si se limitaran a examinar \u00fanicamente los resultados finales.<\/p>\n<p><strong>LLM como juez con r\u00fabricas calibradas<\/strong> Tambi\u00e9n ha madurado r\u00e1pidamente. El uso de un modelo de lenguaje grande (LLM) independiente para evaluar los resultados de los agentes se est\u00e1 convirtiendo en la norma, y la clave para garantizar su fiabilidad es la r\u00fabrica. Defina criterios expl\u00edcitos, proporcione ejemplos clasificados de buen y mal rendimiento, y calibre peri\u00f3dicamente el sistema de evaluaci\u00f3n compar\u00e1ndolo con las valoraciones humanas. Los equipos que aciertan con la r\u00fabrica observan una fuerte correlaci\u00f3n con el juicio humano.<\/p>\n<p><strong>Pruebas basadas en escenarios<\/strong> Es otro enfoque que da buenos resultados. Los equipos m\u00e1s eficaces con los que trabajo mantienen bibliotecas de entre 50 y 200 escenarios que abarcan los flujos normales, los casos extremos, las entradas adversas y los modos de fallo conocidos. Estas bibliotecas crecen con cada incidente de producci\u00f3n y se convierten en uno de los activos m\u00e1s valiosos de un programa de IA aut\u00f3noma.<\/p>\n<p>Y <strong>evaluaci\u00f3n continua en la fase de producci\u00f3n<\/strong> Es lo que lo une todo. Las pruebas previas a la implementaci\u00f3n le aportan confianza en el momento del lanzamiento. La evaluaci\u00f3n continua le aporta confianza cada d\u00eda a partir de entonces. El an\u00e1lisis de muestras de interacciones en producci\u00f3n, su procesamiento a trav\u00e9s de flujos de trabajo de evaluaci\u00f3n y el seguimiento de los indicadores de calidad a lo largo del tiempo permiten a los equipos mejorar los agentes de forma sistem\u00e1tica, en lugar de hacerlo de manera reactiva.<\/p>\n<blockquote><p><em>\u201cLa evaluaci\u00f3n no es algo que se haga antes del lanzamiento y luego se deje de lado. Es una pr\u00e1ctica continua, y los equipos que la abordan de esa manera son los que lanzan productos con confianza\u201d.\u201d<\/em> \u2013 Abhishek Singh, director cient\u00edfico de Data, Artefact<\/p><\/blockquote>\n<h2>Acertar con el modelo de propiedad<\/h2>\n<p>Hay un aspecto organizativo en todo esto que merece la pena abordar.<\/p>\n<p>En el aprendizaje autom\u00e1tico tradicional, el cient\u00edfico de data que creaba el modelo sol\u00eda ser el responsable de su evaluaci\u00f3n. En los sistemas basados en agentes, el alcance es m\u00e1s amplio. El agente interviene en m\u00faltiples procesos de negocio, recurre a herramientas gestionadas por distintos equipos y genera resultados que afectan a las partes interesadas de toda la organizaci\u00f3n. Los modelos de responsabilidad en la evaluaci\u00f3n de los agentes a\u00fan se encuentran en fase de desarrollo en todo el sector, y acertar en este aspecto desde el principio marca una diferencia real.<\/p>\n<p>Los equipos que observamos que lo hacen bien designan claramente a un responsable de la evaluaci\u00f3n \u2014no tiene por qu\u00e9 ser un equipo espec\u00edfico, sino una persona o un departamento encargado de definir los est\u00e1ndares de calidad, crear la infraestructura de evaluaci\u00f3n y exigir al equipo de desarrollo que rinda cuentas seg\u00fan criterios cuantificables\u2014. Dejar clara la responsabilidad desde el principio evita que todos den por sentado que es otra persona la que se encarga de ello.<\/p>\n<h2>Recomendaciones pr\u00e1cticas<\/h2>\n<p>A la luz de lo que hemos observado en los distintos proyectos en los que hemos participado, esto es lo que recomendar\u00eda a los equipos que invierten en IA aut\u00f3noma.<\/p>\n<p>Empiece por el marco de evaluaci\u00f3n, no por el agente. Antes de escribir el c\u00f3digo del agente, defina en qu\u00e9 consiste el \u00e9xito. \u00bfCu\u00e1les son los resultados medibles? \u00bfC\u00f3mo es una buena trayectoria? \u00bfQu\u00e9 tipos de fallos desea detectar a tiempo? Este trabajo previo evita la situaci\u00f3n habitual en la que los equipos crean un agente capaz y luego pasan meses tratando de averiguar c\u00f3mo validarlo.<\/p>\n<p>Invierta en el registro estructurado desde el primer d\u00eda. Cada llamada a una herramienta, cada punto de decisi\u00f3n y cada interacci\u00f3n con un modelo de lenguaje grande (LLM) deben registrarse en un formato estructurado y consultable. Sin ello, solo podr\u00e1 evaluar los resultados sin comprender c\u00f3mo ha llegado el agente a ellos. Incorporar la observabilidad a posteriori resulta m\u00e1s costoso que integrarla desde el principio.<\/p>\n<p>Cree una biblioteca de escenarios y consid\u00e9rela un activo de primer orden. Gestione sus versiones, rev\u00edsela y ampl\u00edela con cada incidente de producci\u00f3n.<\/p>\n<p>Planifique una evaluaci\u00f3n continua desde el principio. Y designe cuanto antes a una persona claramente responsable de la evaluaci\u00f3n: los equipos que pasan m\u00e1s r\u00e1pidamente de la fase piloto a la de producci\u00f3n son aquellos en los que hay alguien que asume expl\u00edcitamente la responsabilidad de la calidad de los agentes.<\/p>\n<h2>C\u00f3mo abordamos esta cuesti\u00f3n en Artefact<\/h2>\n<p>En Artefact, la evaluaci\u00f3n forma parte integrante de nuestra metodolog\u00eda \u00abAI Factory\u00bb como l\u00ednea de trabajo fundamental. Cada proyecto de desarrollo de un agente incluye una fase de dise\u00f1o del marco de evaluaci\u00f3n que se lleva a cabo en paralelo al desarrollo del agente. Definimos criterios de evaluaci\u00f3n a nivel de trayectoria, creamos bibliotecas de escenarios adaptadas al caso de uso y establecemos un seguimiento continuo antes de que el agente entre en funcionamiento.<\/p>\n<p>El razonamiento que subyace a esto es sencillo: un agente que se puede medir es un agente en el que se puede confiar, que se puede mejorar y que se puede ampliar. Las organizaciones con las que colaboramos y que adoptan esta disciplina desde el principio alcanzan sistem\u00e1ticamente la fase de producci\u00f3n m\u00e1s r\u00e1pidamente y con mayor confianza por parte de las partes interesadas.<\/p>\n<h2>La evaluaci\u00f3n como ventaja competitiva<\/h2>\n<p>La IA agencial est\u00e1 madurando r\u00e1pidamente. Los marcos de trabajo son mejores, los modelos son m\u00e1s potentes y los casos de uso son reales. La evaluaci\u00f3n se est\u00e1 poniendo al d\u00eda, y las organizaciones que invierten en ella ahora est\u00e1n consiguiendo una ventaja real.<\/p>\n<p>Si se lleva a cabo correctamente, la evaluaci\u00f3n es lo que le permite implementar agentes con confianza, mejorarlos con el tiempo y presentar pruebas tangibles a las partes interesadas, en lugar de simples demostraciones. Se trata de una disciplina relativamente nueva, pero los enfoques se est\u00e1n comprendiendo cada vez mejor, y los equipos que los adopten desde el principio estar\u00e1n bien posicionados cuando la IA agentiva se convierta en un elemento habitual del funcionamiento de las empresas.<\/p>","protected":false},"excerpt":{"rendered":"<p>Un cliente con el que colaboramos el a\u00f1o pasado desarroll\u00f3 un agente de inteligencia artificial para las solicitudes de adquisici\u00f3n. Este analizaba los documentos de los proveedores, comparaba precios, se\u00f1alaba riesgos de cumplimiento normativo y elaboraba recomendaciones. Funcionaba bien. Sin embargo, al cabo de un par de meses en producci\u00f3n, el equipo se top\u00f3 con una pregunta para la que no ten\u00eda una respuesta satisfactoria: \u00bfc\u00f3mo medimos si los resultados son consistentemente buenos?<\/p>","protected":false},"featured_media":1402298,"parent":0,"template":"","meta":{"_acf_changed":false,"ep_exclude_from_search":false},"blog-category":[2995],"blog-language":[2991],"class_list":["post-1402297","blog","type-blog","status-publish","has-post-thumbnail","hentry","blog-category-ai-technology","blog-language-en"],"acf":[],"_links":{"self":[{"href":"https:\/\/www.artefact.com\/es\/wp-json\/wp\/v2\/blog\/1402297","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.artefact.com\/es\/wp-json\/wp\/v2\/blog"}],"about":[{"href":"https:\/\/www.artefact.com\/es\/wp-json\/wp\/v2\/types\/blog"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.artefact.com\/es\/wp-json\/wp\/v2\/media\/1402298"}],"wp:attachment":[{"href":"https:\/\/www.artefact.com\/es\/wp-json\/wp\/v2\/media?parent=1402297"}],"wp:term":[{"taxonomy":"blog-category","embeddable":true,"href":"https:\/\/www.artefact.com\/es\/wp-json\/wp\/v2\/blog-category?post=1402297"},{"taxonomy":"blog-language","embeddable":true,"href":"https:\/\/www.artefact.com\/es\/wp-json\/wp\/v2\/blog-language?post=1402297"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}