导言

我们去年合作的一家客户开发了一个用于采购请求的人工智能代理。该系统能够解析供应商文件、比较价格、标记合规风险并起草建议。系统运行良好。但在投入生产运行几个月后,团队遇到一个他们无法很好回答的问题:如何衡量输出结果是否始终保持高质量?

他们每周对少数几起案例进行人工抽查。有些请求触发了合规警报,而一些看似相似的请求却未触发。价格对比大多准确,但偶尔会出现具有实质影响的偏差。该客服代表确实创造了价值,但团队缺乏系统化的方法来量化其价值大小,也无法追踪服务质量是有所提升还是在下滑。.

这是代理式人工智能应用过程中一个常见的阶段。该系统在实际任务中表现已足够出色,而组织也已准备好从“它能用”迈向“我们能证明它有效”。这一转变需要一种与大多数团队惯用的评估方式不同的评估方法,这也是当前各组织正在构建的最重要能力之一。.

为什么代理商需要自己的评估方法

传统机器学习的评估指标很明确:精确率、召回率、AUC。即使是早期的生成式人工智能,也能借助人类偏好评分和data基准数据集进行评估。而智能体的情况截然不同,因此这些方法无法直接迁移。.

主要原因是代理在多个步骤中进行操作。它们会做出分支决策、调用工具、从错误中恢复,并产生取决于其所选路径的结果。 如果用相同的输入两次运行同一个智能体,可能会得到不同的工具调用序列、不同的中间推理过程以及不同的最终输出——而所有这些结果都完全可能成立。一个通过与预期不同的步骤序列来解决问题智能体,并不算错。它甚至可能更好。.

这意味着评估方法需要不断演进。在Artefact,我们一直在各项主动参与项目中探索切实可行的解决方案,目前已逐渐形成一套在实际生产环境中表现良好的明确模式。.

代理评估有何不同之处

有三点使得评估代理与评估模型有所不同。.

第一个是 非决定性. 在经典机器学习中,你会使用测试集对模型进行评估,并得到一个稳定的数值。而在智能代理中,输出结果取决于一连串的大语言模型调用、工具调用以及分支决策。当存在多种有效的执行顺序时,断言“智能代理必须先调用函数 X 再调用函数 Y”是行不通的。 评估需要考虑通向同一结果的多条正确路径。.

第二个是 路径依赖. 代理的最终答案是一系列决策的产物,每个决策都会影响后续决策。两个代理可能产生相同的正确输出,但其中一个是在过程中经历了工具故障后恢复过来的,而另一个则恰好避开了该故障。仅看最终输出会忽略这一差异。理解推理路径能让你更全面地了解系统的鲁棒性。.

第三个是 上下文相关的正确性. 在许多企业应用场景中,质量是一个连续的谱系。一位能谈下12%折扣的采购专员就是优秀的。.

能够协商出15%的方案更好。而如果能协商出10%,同时又能维系关键供应商关系,那可能才是最佳方案。有意义的评估需要反映业务背景,而不仅仅是结果对错。.

在生产环境中行之有效的方法

一些方法已经取得了良好的效果,其共同点在于将智能体更多地视为系统,而非模型。.

轨迹级评估 这可能是影响最大的转变。团队不再仅对最终结果进行评分,而是评估智能体行动的完整序列。智能体是否识别出了正确的子任务? 是否使用了合适的工具?是否从错误中恢复过来?是否在该升级处理时进行了升级?这需要对智能体的每一步操作进行结构化日志记录,并制定能够对整个执行过程进行综合评分的评分标准。与仅关注最终结果相比,这能让团队更全面地了解智能体的质量。.

采用经过校准的评分标准的LLM担任评委 这一领域也发展迅速。使用独立的大语言模型(LLM)来评估智能代理的输出结果正逐渐成为标准做法,而确保其可靠性的关键在于评分标准。需要明确界定评估标准,提供表现优异与表现不佳的分级示例,并定期根据人类评估结果对评分模型进行校准。那些制定出合理评分标准的团队,其评估结果与人类判断之间呈现出高度相关性。.

基于场景的测试 这是一种成效显著的另一种方法。我合作过的最有效的团队都会维护包含50到200个场景的库,涵盖正常流程、边界情况、对抗性输入以及已知的故障模式。这些场景会随着每次生产环境中的事件而不断丰富,并成为自主人工智能项目中最宝贵的资产之一。.

而且 生产环境中的持续评估 将这一切有机地结合在一起。部署前的测试能让您在上线时充满信心。持续评估则让您在后续的日常运营中始终保持信心。通过抽样采集生产环境中的交互数据,将其纳入评估管道进行分析,并随时间推移追踪质量指标,团队便能系统性地优化聊天机器人,而非被动应对问题。.

“评估并非只是在发布前做一次然后就了事的事情。它是一项持续的实践,而那些将其视为持续实践的团队,才是能够充满信心地推出产品的团队。” – 阿比谢克·辛格,Data 科学总监,Artefact

确立正确的所有权模式

此事在组织层面也有值得探讨的地方。.

在传统的机器学习中,构建模型的“data”科学家通常负责该模型的评估工作。而在智能代理系统中,其范围更为广泛。智能代理涉及多个业务流程,调用由不同团队维护的工具,并产生影响整个组织内各利益相关方的结果。 整个行业中,关于智能体评估的责任归属模式仍在形成之中,而尽早确立正确的模式将产生实质性的影响。.

我们观察到在这方面表现出色的团队都会明确指定一名评估负责人——不一定是专门的团队,而是一个负责制定质量标准、构建评估基础设施,并确保开发工作符合可衡量标准的人员或职能部门。尽早明确责任归属,可以避免出现“人人都以为是别人在处理”的情况。.

实用建议

根据我们在各项合作项目中的观察,对于正在投资代理式人工智能的团队,我建议如下:.

应从评估框架入手,而非直接从智能体开始。在编写智能体代码之前,先明确成功的标准。可衡量的结果是什么?理想的运行轨迹应是什么样子的?希望尽早发现哪些故障模式?这项前期工作可以避免团队常出现的这种情况:先开发出一个功能完善的智能体,随后却要花费数月时间来研究如何对其进行验证。.

从一开始就投资于结构化日志记录。每次工具调用、每个决策点、每次与大型语言模型(LLM)的交互,都应以结构化且可查询的格式进行记录。如果没有结构化日志,您只能评估输出结果,却无法理解智能体是如何得出这些结果的。事后补建可观测性,其成本远高于从一开始就将其纳入系统。.

建立一个场景库,并将其视为一项重要资产。对其进行版本管理、审查,并随着每次生产环境事件的发生不断完善它。.

从一开始就制定持续评估计划。并尽早明确评估负责人——那些从试点阶段向生产环境过渡最快的团队,往往都有人明确负责代理质量。.

Artefact对此采取的处理方式

在 Artefact,评估作为核心工作流被融入了我们的“AI Factory”方法论之中。每次智能代理开发项目都包含一个评估框架设计阶段,该阶段与智能代理开发工作并行进行。我们会定义轨迹级评估标准,构建针对具体用例量身定制的场景库,并在智能代理上线前建立持续监控机制。.

其背后的思路很简单:能够被衡量的代理,才是值得信赖、能够改进并实现规模化的代理。我们合作中那些早期就采用这一方法的组织,总能更快地投入生产,并赢得利益相关者的更高信任。.

评估作为竞争优势

代理式人工智能正在迅速成熟。框架更加完善,模型功能更强大,应用场景也已落地。评估方法正在迎头赶上,现在投资该领域的组织正在建立真正的竞争优势。.

如果实施得当,评估能让你充满信心地部署智能代理,随着时间的推移不断改进它们,并向利益相关者展示实际证据而非演示。这一领域虽然相对较新,但相关方法已逐渐被广泛理解;随着智能代理AI逐渐成为企业运营的标准组成部分,率先采用这些方法的团队将占据有利地位。.