面向高管的实用指南:如何应对“能动性转变”
这一切通常始于会议室。供应商打开笔记本电脑,在聊天框中输入一句话,然后看着业务代表从三个系统中调取data数据、汇总租户合同、标记需法律审核的条款,并将结果通过电子邮件发送给资产管理团队。 整个过程仅需九十秒。会议室顿时鸦雀无声,随后有人问道:“这个系统花了多长时间才建好?”当听到“一个下午”这个答案时,正是大多数企业人工智能战略悄然重绘的时刻。.
这是一个合理的问题,乍一看还挺引人入胜。如果一个能正常运行的系统只需一个下午就能搭建起来,那我们为什么还要在每次数字化转型上花费十八个月的时间?为什么我们要为功能更有限的软件支付七位数的费用?而且,更紧迫的是,我们应该如何应对这一问题?
坦率地说,实际情况比演示所展示的要复杂得多。没错,你绝对可以在几小时内构建出一个能正常运行的AI代理。现在的工具确实已经非常成熟。但一个能正常运行的代理与企业级代理之间的差距,比大多数高管预期的要大得多,而几乎所有的实际成本、风险和价值都正体现在这一点上。.
本文面向希望了解当今究竟哪些事情切实可行、哪些真正困难,以及如何快速推进工作,同时避免做出那些在五月看来高明、到了十一月却令人尴尬的决策的高管。 我们将探讨智能代理的本质、其局限性、应用场景、开发主体,以及在受监管的企业中如何正确部署它们。读完本文后,您应该能够自信地参加下一次董事会会议,并清晰地阐述这一领域的发展现状。.
所谓AI代理,究竟是什么?
在着手部署之前,有必要先停下来思考一下,“AI 代理”这一术语究竟指代什么。过去十八个月里,这个词已被市场营销团队滥用得面目全非,大多数高管都难以分辨,对方向他们推销的究竟是 AI 代理、聊天机器人、工作流工具,还是一个特别“强势”的宏。.
最简洁的定义是:人工智能代理是一种软件,它利用基础模型来理解目标、规划实现目标的方案、通过调用工具和系统采取行动,并根据所观察到的信息进行适应。 不妨将其视为一名数字毕业生。它能力出众,能够阅读说明,懂得寻求帮助,会使用你提供的工具,并且在既定的职责范围内,无需持续监督即可做出明智的决策。就像一名毕业生一样,明确的规范和资深同事对其影响较大的工作进行审核,都能使其受益匪浅。.
从结构上讲,每个智能体都依托于五项能力。基础模型提供推理引擎,例如 Claude ‘Sonnet’、GPT ‘4o’、Gemini ‘3.5 Flash’。 工具赋予智能体执行操作的能力:查询data数据库、发送电子邮件、检索文档、执行计算等。 记忆使其能够在不同步骤间保持上下文,而在更复杂的智能体中,甚至能在不同会话间保持上下文。协调机制负责规划和路径规划——决定下一步该做什么、何时升级处理、何时停止。而防护机制则定义了边界:智能体被允许做什么、可以访问哪些data数据、何时必须由人类批准。.

图1. 人工智能代理的五个组成部分。.
这种结构划分之所以重要,是因为它阐明了智能体与那些常被混淆的对象之间的区别。聊天机器人拥有模型,可能还具备一定的记忆能力,但没有真正的工具,也没有协调能力;它只会说话,而不会采取行动。RPA拥有工具和协调能力,但缺乏推理能力——它只是按照脚本行事,一旦现实情况偏离脚本,系统就会失灵。 传统机器学习具备狭义的推理能力,但缺乏通用智能、工具使用能力以及对话界面。智能代理则融合了这五大要素。这正是它之所以有用、之所以新颖的原因。.
还有一点区别值得特别注意:智能体是概率性的,而非确定性的。它们有时会做出出人意料的举动。在许多应用场景中,这是其优势所在——正是这一特性使它们能够处理那些曾让前几代自动化系统束手无策的复杂边界情况;但在其他场景中,这却可能成为弊端。能够区分这两种情况,就是这项工作的核心所在。.
高管真正需要的分类法
如果“AI代理”这一术语涵盖了从日常定时报告到自主交易系统的一切内容,那么它就失去了实际意义。参照Gartner、Forrester以及各大平台目前对这一领域的描述,我们认为将该领域划分为五个自主程度逐渐提高的类别进行思考会更有帮助。.

图2. 代理系统的实用分类法。.
计划中的操作 属于最基础的层面。这些自动化功能通过定时器或触发器运行;例如每日KPI报告、早上7点的收件箱清理,以及在CRM中交易达成时触发的webhook。 它们可能在某个步骤中使用大型语言模型(例如总结文档、起草邮件),但无法推断下一步该做什么。大多数高管已经拥有好几项此类功能;在营销重新定位之前,它们就被称为“自动化”。.
任务代理 在此场景中加入一个由大型语言模型(LLM)驱动的、具有明确作用域的单一任务。一个典型的例子是:一个智能代理,它会读取每封收到的电子邮件,根据主题和紧急程度进行分类,并将其转发给相应的团队。 虽然其中涉及推理,但仅发生在单个节点上。其周围的流程是确定性的。这类方案极其实用、成本极低,也是大多数组织自然的切入点。.
自动化代理 将定义好的工作流中的多个步骤串联起来。虽然这些步骤仍然受到限制且预先已知,但大型语言模型(LLM)会在多个环节做出决策:决定调用哪个工具、检索哪个data,以及检查失败时该如何处理。 一个典型的例子是发票审批流程:该流程读取PDF文件,提取明细项目,将其与采购订单进行匹配,并最终完成审批或转交审核。.
工作流代理 这里正是当今大多数真正令人兴奋的企业工作正在开展的地方。这些智能代理获得的是一项预期结果,而非具体操作序列,例如“摘要这篇80页的租赁合同,并指出任何值得关注的问题”,它们会自行决定如何达成目标。它们会阅读文档、查询系统、提出后续问题,并进行迭代。 其工作流程是自发形成的,而非预先定义的。在过去十二个月里,推理模型的进步使这一类别的可靠性得到了显著提升。.
多智能体系统 就是前沿领域。协调代理会将一个目标分解为子任务,并将每个子任务分配给一位专家:一位负责研究,一位负责分析,一位负责起草,一位负责审核。如果设计得当,多代理系统能够处理单个代理无法完成的工作;但如果设计不当,在实现相同结果的情况下,其故障模式会增加八倍。大多数企业不应从这里入手。.
当供应商向您推销某款产品时,不妨简单问一句:它在这一谱系中处于什么位置?如果对方向您展示的是定时操作,却按工作流代理的标准向您收费,那么您刚刚就识别出了市场上最常见的代理类产品过度销售形式。 反之,如果你的团队正试图将多代理系统作为首次部署,不妨委婉地建议他们从左侧的下一列开始着手。.
为什么是现在?
多年来一直承诺会推出智能代理。现在有什么变化了吗?
有三点因素共同促成了这一局面。首先,基础模型在工具使用方面的可靠性已达到门槛。两年前,让模型调用API并利用结果还常常令人失望;如今,入门级的Claude、GPT和Gemini模型都能处理多步骤工具操作,其成功率已足以满足生产环境的需求。 其次,推理模型:具备扩展推理能力的Claude、OpenAI的o系列,以及Gemini的深度推理模式,在真实工作流所需的多步骤、高度依赖判断力的任务上,显著提升了性能。 第三,必要的支撑架构终于就位:包括 LangGraph 和 CrewAI 在内的编排框架,或是众多低代码工作流解决方案之一;用于系统化测试的评估工具;以及模型上下文协议(MCP),它为智能代理提供了一种标准化的方式,使其能够与企业实际运行的数十个系统进行集成。.
成本曲线也起到了推动作用。前沿智能的单代币价格在两年内下降了一个数量级,而轻量级模型(Claude Haiku、GPT-mini、Gemini Flash)如今的价格已足够低廉,足以支持企业对每封电子邮件或每份文档进行大规模处理。.
其结果是,我们正处于一个难得一见的时刻:技术真正成熟,工具真正实用,经济模式也真正可行。 加之监管框架已初具雏形——《欧盟人工智能法案》已成为明确的基准而非不断变化的目标,且包括沙特阿拉伯SDAIA在内的海湾地区监管机构均已发布明确立场;2025–26年将成为关键转折点,届时严肃认真的企业将从试验阶段转向实际部署。.
“短短几小时”的现实检验
那么,真的能在几小时内构建一个企业级代理吗?答案既是“是”,也是“否”,而二者之间的差距正是本文的价值所在。.
一个下午你绝对能做出什么:一个能执行实际任务的、可正常运行的智能代理。选择一个用例,比如总结和分类共享收件箱中的内容。打开 Claude Projects、n8n 或你喜欢的其他平台。 配置收件箱访问权限,编写一份清晰描述任务的提示语,提供包含历史案例的知识库,并设定执行计划。到下午结束时,你将拥有一个能完成真正有用工作的智能代理。 把它展示给你的同事看。他们一定会印象深刻。这并非什么花招,而是底层工具发展到何种程度的明证。.
一个下午无法完成的工作,正是那个演示版本与实际部署给分布在三个司法管辖区的两千名员工之间的区别。要实现这一点,你需要访问控制机制,确保代理仅显示每位用户被允许查看的内容。 你需要一条审计日志,记录每一个决策和每次工具调用。你需要一个评估框架,告诉你代理的正确率为95%还是70%,以及它通常会在哪些地方出错。 你需要成本控制,因为一个不受约束的代理可能在几天内就耗尽六位数的预算。对于影响重大的决策,你需要设置人工介入的检查点。对于重视数据驻留要求的地区(而且越来越多的地区都在重视这一点),你需要妥善处理 data 数据驻留问题。 当模型不可用时,你需要备用方案。你需要可观测性,以便运维团队能够掌握系统运行状况。此外,你还需要制定变更管理计划,确保员工真正使用该系统。.
根据我们的经验,将原型产品投入生产所需的努力通常是开发原型所需努力的10到20倍。一个开发人员花三天时间构建的代理程序,一个小型团队需要花三个月才能将其打造成企业级产品。这并非技术上的失败,而是在大型组织内负责任地开展任何工作的现实情况。 这一倍数关系同样适用于CRM系统部署、data platform项目以及支付系统集成。不同之处在于,这些项目的演示效果并不那么出色,无法让人因此忽略其他方面。.
对“几小时”这一说法正确的解读是:代理型原型如今确实成本低廉,而代理型生成则不然。关键在于区分二者,并利用前者的低成本优势,从而就后者做出更明智的决策。.
代理程序实际上是如何构建的?
目前构建智能体主要有三种方法,每种方法都有其独特的audience值、上限以及取舍。.
可视化构建器
这些平台允许用户通过在画布上拖拽节点来组装自动化流程。n8n、Make(原名Integromat)、Zapier的AI产品以及微软的Copilot Studio是其中的领军者。模型位于一个节点中,工具位于其他节点中,用户通过线条将它们连接起来。 可视化构建器在原型设计以及那些类似于经典自动化但附加了 LLM 步骤的应用场景中表现尤为出色。它们在让更多人能够参与构建方面也发挥了非凡的作用。 一位毫无编程经验的业务分析师,午休前就能让一个实用的自动化代理投入运行。虽然存在性能上限,但距离这一上限还很遥远;当工作流出现深度分支、状态需要在多个步骤间传递,或者需要精确调整延迟和成本时,可视化构建器才会开始显露局限。对于许多内部应用场景而言,这样的性能上限已经足够了。.
基于提示的平台
Claude Projects、ChatGPT 自定义 GPT、Gemini Gems 以及 Microsoft Copilot 代理,都允许您通过编写一套详尽的指令、附加知识库并授予对精选工具集的访问权限来构建系统。这里没有可视化画布,所谓的“构建”其实就是一场对话。 这些平台非常适合构建知识代理、研究助理、内部专家,以及任何价值源于提示词和文档质量而非工作流复杂性的用例。对于许多高管而言,这也是理想的入门选择,因为它们完全不需要工程人员参与,且只需一次操作就能产出真正有用的成果。.
代码驱动的框架
LangGraph、CrewAI、AutoGen 以及 LangChain 生态系统使工程团队能够完全掌控编排、内存、状态、评估和部署。 这些平台还托管着 Anthropic 自有的 Agent SDK 以及主要 cloud 提供商的智能体服务。基于代码的构建虽然耗时更长、需要工程师参与,但在风险高、集成深度大且智能体需要每天处理数千次请求的情况下,这正是您理想的选择。.
坦率地说,大多数企业最终都会同时采用这三种方案:用于快速原型设计和轻量级后台自动化处理的可视化构建工具;用于知识管理和助手类用例、能够赋能各团队的提示驱动型平台;以及用于真正关键的代理——即位于业务流程或客户交互关键路径上的那些代理——的代码驱动型框架。 将这些视为相互竞争的阵营而非互补的层级,是一个常见的误区,这种误区会导致对简单问题过度设计,而对复杂问题设计不足。.
决策很少是关于哪种工具最好,而是关于哪种工具最适合眼前的具体应用场景。.
到底谁能造出来呢?
这是高管们最常问的问题,通常都是悄悄问的。答案确实令人鼓舞:基本上任何人都可以,至少在起步阶段是这样。.
进入智能代理领域的门槛已经实现了民主化,这种程度是极少数技术变革所能做到的。三年前,“构建一个人工智能系统”还需要data科学家、MLOps工程师以及相应的预算。 如今,一位对自身业务流程有深入了解的财务经理,无需编写任何代码,就能在Claude或Copilot Studio中构建出可运行的智能代理。我们已经看到这种现象在各个职能部门中普遍发生:法务团队构建合同审查智能代理,人力资源团队构建入职辅助工具,勘测人员构建租赁摘要工具,销售团队构建提案生成器。 真正重要的技能并非编程,而是对任务的清晰思考:任务“完成”的标准是什么,智能代理需要掌握哪些信息,以及在哪些环节需要人工介入。.
这并不意味着工程工作已无足轻重,而是说明工程的作用发生了转变。我们所见到的最佳运营模式中,IT 部门已从“守门人”转变为“赋能者”,提供平台、防护措施、访问模式和评估框架,让业务用户能在这些框架内进行开发。 工程团队负责建造航站楼和跑道;业务团队则负责制造飞机。当业务用户构建的某项成果重要性足够高,需要进行强化加固时,工程团队便会接手并将其投入生产环境。这正是人们所谈论的真正意义上的“民主化”,而且它确实存在。.
这对高管们而言意义重大。起步时,您无需组建一支人工智能工程师团队。 你需要为最贴近实际工作的人员提供工具、授权以及少量培训。在客户业务中真正带来突破的智能代理,几乎从来都不是中央战略部门所设想的那样。它们是由实际执行工作的人员构建的,这些人最清楚哪里存在阻力。.
“能动性”理念在当今社会正逐渐深入人心
关于经纪人未来的讨论往往忽略了当下,这实在令人惋惜,因为当下比人们想象的要有趣得多。纵观我们的客户群体——包括全球企业、公共部门机构,尤其是房地产行业——目前有少数几种模式正在持续创造价值。这些模式值得我们了解。.
研究与综合。. 能够跨文档、网络资源和内部系统进行阅读,并生成结构化摘要的工具。广泛应用于市场情报、竞争对手分析、尽职调查、投资筛选和政策审查等领域。该工具非常适合此类工作,因为这类工作需要大量判断力、具有重复性,且最终可由人工审核人员进行复核。.
文档处理。. 租赁摘要、合同审核、发票处理、理赔处理以及客户尽职调查(KYC)。凡是需要将非结构化文档转换为结构化data格式,并为需要人工处理的案例添加标记的场景,均可适用。这是受监管行业(包括房地产行业)中最常见的单项生产部署。.
客户与员工服务。. 一线分流系统完全处理简单的案例,并将其余案例连同完整背景信息一并上报。如果运作得当,这些智能代理并非取代人类,而是确保人类只处理那些真正需要他们介入的案例。.
内部知识。. 这些智能助手能够集成到企业的文档、维基、工单系统和电子邮件存档中,并以自然语言回答问题。许多企业认为,这是实现价值最快、最简单的方式,也是变革管理最平稳的领域,因为智能助手是作为辅助而非替代手段存在的。.
代码生成。. 这一点值得提及,因为这是所有用例中进展最快的。如今,工程团队在使用代理式编码工具时,生产力通常能提高30–40%,而且这一差距还在不断拉大。即使是非工程背景的高管也应予以关注,因为这会改变你们开发的其他所有软件的成本曲线。.
合规与保证。. 用于监控安全漏洞、准备审计工作并发现异常情况的代理程序。在欧盟、英国和海湾地区监管日益严格的情况下,这一点尤为重要。.
优秀的用例有哪些共同点?我们与客户分享过一个有用的经验法则:该任务具有足够的重复性,以至于值得关注;需要大量判断,以至于传统自动化手段已无法应对;边界足够明确,以至于可以用一句话描述成功标准;并且对于关键用例,能够容纳“人机协同”的审核流程。 如果一个候选用例满足以上四点,那么它很可能值得进行试点。如果满足三点,值得进一步探讨。如果只满足一点,那就有些勉强了。.
三个例题解析
抽象概念的作用仅限于一定程度。为了具体说明这一点,以下列举了三个源自现实世界的实例,这些实例反映了当今各行业中智能代理的实际部署情况。.
商业地产中的租赁摘要
某家中型房地产公司在其管理的物业组合中持有数千份租赁协议。 每份租赁合同包含40至90页内容密集的法律文本,以PDF格式存储在文档管理系统中。资产管理团队需要能够随时查阅每份租赁合同的具体内容:租金调整日期、合同解除条款、服务费规定、转让限制、ESG相关义务,以及任何可能影响估值或风险的特殊条款。.
从历史上看,这原本是法律助理的工作。过去,每完成一笔新收购,需要花费六周时间进行人工摘要提取,才能对资产进行规范建模。如今,工作流代理只需十五分钟即可完成同一份租赁合同的摘要提取,并按律所偏好的结构化方案进行整理,同时对任何异常情况进行标记,以便特许测量师进行审核。 首个版本在可视化构建器中的开发时间约为一周。将其强化以投入生产环境、添加审计追踪、针对标注过的租赁合同语料库进行评估测试、与文档管理系统及资产登记册集成,以及为模棱两可的条款建立周密的上报流程,共耗时四个月。 投资回报期不到一年,而此前在每笔交易中都构成瓶颈的工作,如今已不再是任何环节的瓶颈。.
某跨国公司的内部IT服务台
某家拥有1.5万名员工的全球性服务公司运营着一个内部服务台,但该服务台已不堪重负。大多数工单都属于几十种常见类型的变体:密码重置、软件访问请求、VPN问题、费用系统查询等。 该团队估算,如果能够提供适当的背景信息和工具,其中60%的工单无需人工干预即可解决。.
他们开发了一个任务代理——一个嵌入现有工单平台的、具有明确作用域的单步大型语言模型(LLM),该代理会读取每条 incoming 工单,尝试使用一小套预先批准的工具(身份系统、软件目录、费用 API)直接解决该工单, 随后要么直接关闭工单,要么将工单连同回复草稿和完整上下文一并转交给人工处理。初始原型的开发时间:两天。 投入生产的时间:三个月,主要用于实现访问控制、审计日志记录以及调整升级阈值,以确保没有重要事项被遗漏。结果:工单解决时间缩短了70%,一线团队被重新部署到更有意义的工作中,该代理目前处理了约一半的入站工单量。.
沙特阿拉伯王国符合“2030愿景”的投资研究
一家与主权基金相关的投资机构希望系统性地筛选投资机会,将其与“2030愿景”的优先事项、被列为多元化发展重点的行业、区域发展目标,以及针对沙特国情制定的ESG标准进行比对。潜在投资标的、简报文件和监管备案材料的数量庞大,以至于没有任何一支人工团队能够对其进行全面审查。.
在此情境下,多智能体系统是最佳解决方案。一个研究智能体从公开文件、新闻以及授权的data数据库中提取并整理了关于每个投资机会的信息;一个分析智能体根据“2030愿景”框架评估了这些机会与该框架的一致性;一个风险智能体则指出了监管和声誉方面的风险。 起草代理为投资委员会生成了一份结构化的简报。原型构建时间约为三周,因为多代理协调需要真正的工程技术支持。 生产环境强化工作耗时六个月,期间特别关注data本地化(所有系统必须在沙特境内运行)、阿拉伯语处理,以及基于历史决策的严格评估框架。该系统目前处理的投资机会数量已超过此前的人工团队,投资委员会不仅能获得更全面的简报,还能将审查重点集中在真正重大的决策上。.
这三者中最引人注目的是时间比例。在每种情况下,原型开发耗时数天到数周,而生产环境部署则耗时数月。而且,在每种情况下,如果不同时进行这两步,就无法实现价值。原型开发证明了其可行性,而生产环境部署则实现了价值。.
选择基础模型
迟早有一天,负责推动经纪人计划的高管会被问到:我们应该采用哪种模式?诚实的答案是“这要视情况而定,而且可能不止一种”,但如果不加以详细说明,这个答案就没什么用。以下是对2026年主要选项的客观分析。.
Frontier 已关闭的模型服务
克劳德(Anthropic)。. 普遍被认为在逻辑推理方面最为强大,尤其在工具使用、长上下文处理、复杂推理和审慎判断方面表现突出。扩展的思维模式使Claude在处理复杂任务时更具优势。在遵循细微差别丰富的指令方面表现卓越,这在设计中包含防护措施时尤为重要。 具备强大的企业级姿态,在data培训、知识产权赔偿以及日益完善的企业级管控体系方面立场明确。权衡因素:每令牌成本处于前沿层级的较高水平,且在主要cloud地区以外的可用性历来落后于其他服务商。.
GPT(OpenAI)。. 这里汇聚了部署最广泛、知名度最高的 Frontier 模型,拥有最完善的工具、集成和现成代理生态系统。o-系列推理模型在最棘手的任务中表现出色。 在代码处理方面表现强劲,在开发者体验方面尤为出色。取舍:模型行为在各版本间发生了明显变化,这对注重一致性的生产系统而言可能令人不安。企业级定价和策略已趋于成熟,尽管部分组织出于敏感性考虑仍持谨慎态度。与Claude生成的内容相比,GPT生成的内容通常被认为更为流畅。.
Gemini(谷歌)。. 在多模态任务上表现卓越(在原生处理图像、视频和音频方面,它是这三者中最强的),并与 Google Workspace 及 Google Cloud 生态系统紧密集成。Gemini Flash 在大规模部署时成本确实低廉,这使其成为高吞吐量、低复杂度工作负载的默认选择。 取舍:在复杂的代理任务上,其推理能力与 Claude 及 o 系列的差距虽已缩小,但尚未完全弥合。.
不限重量级车型
Llama(Meta)。. 部署最广泛的开放式字体家族,拥有强大的生态系统支持,且在大字号下表现出色。 当需要为data驻留环境进行自主部署、在极大规模下实现成本可预测性,或受组织政策限制时,这是自然之选。权衡:许可条款虽可行,但不如真正开放的许可那样宽松;在最困难的推理任务上,其性能仍落后于前沿水平。.
米斯特拉尔。. 总部位于欧洲,拥有涵盖多种规模的强大模型,且采用企业友好的许可模式。对于关注数据主权的欧洲客户而言是理想之选,且在大规模部署中的表现日益出色。Mistral的小型模型作为路由部署中的主力层,表现尤为出色。 取舍:生态系统比 Llama 更为有限,且推理能力仍与前沿的闭源模型存在一定差距。.
Qwen(阿里巴巴)。. 过去一年中进步最快的总部位于中国的家族企业。具备强大的多语言处理能力,尤其是中文和阿拉伯语,且在大规模业务方面表现出色。对于在亚洲和海湾地区开展业务的组织而言,其重要性日益凸显。权衡因素:组织层面的考量因司法管辖区而异;部分企业无论其能力如何,都不会考虑中国本土模式。.
Artefact的决策框架
在实际操作中,我们鼓励客户从两个维度来思考:任务的复杂程度如何,以及data的敏感程度如何?

图3. 用于选择基础模型的双轴决策框架。.
对于在非敏感的 data 上处理复杂任务时,通过托管 API 调用 Claude、GPT 或 Gemini 的前沿闭源模型,几乎总是最佳的起点。推理质量比成本或部署开销更为重要。.
对于涉及敏感数据(如患者病历、金融交易、主权数据等)的复杂任务,自建的开放式模型正变得越来越可行,尤其是在使用Llama这类大型模型时。其性能足以满足大多数企业级任务的需求;而数据驻留和控制权则是不可妥协的。.
对于在非敏感的 data 环境下进行的简单任务,轻量级模型层——Claude Haiku、GPT-mini 和 Gemini Flash——能够以边际成本处理海量数据。这就是按每封邮件、每份文档、每笔交易计费的智能代理所发挥作用的领域。.
对于在敏感的 data 上处理简单任务的情况,通常采用小型自托管模型(如 Mistral small、Qwen 2.5 或经过微调的 Llama)是最具成本效益的解决方案。.
该任务的要求并不高,因此较小的模型就足够了,而通过自主托管可以解决敏感性问题。.
目前最先进的部署方案能够在这四个象限之间进行动态路由。当收到用户请求时,一个小型路由模型会对其进行分类,并将请求发送给能够处理该请求且成本最低的模型。这正是大规模运营中经济效益的实际运作方式,也是企业避免在常规任务上支付过高成本,同时又确保复杂任务得到充分处理的关键所在。.
再提一点:不要把自己困住。在设计代理平台时,应确保模型可替换。六个月后的领军者可能与今天的领军者不同;模型层应是一个可替换的组件,而非结构性的固定方案。如果某供应商的方案难以实现这一点,请询问原因。.
阻碍因素,包括技术性和组织性因素
如果你认真阅读这篇文章,这一部分你最好读两遍。对于任何真正实施过企业级代理部署的人来说,其中的障碍都是众所周知的,这些障碍大致平分在技术层面和组织层面。 根据我们的经验,组织层面是更难的一半,也是大多数领导团队投资不足的一方面。.

图4. 最常导致能动性计划停滞的阻碍因素。.
技术型拦网手
Data 品质。. 代理型飞行员无法实现规模化的最主要原因。代理的性能完全取决于其所连接的data系统的质量。格式不统一、记录重复、字段缺失以及孤立的data数据源,都会迅速导致其失效。 在试点项目开始前(而非结束后)进行data审计,是大多数组织能够采取的成本最低的改进措施。.
无结构的 data 蔓延。. 对于大多数企业而言,70–80% 的重要信息中,有 data 存储在 PDF 文件、电子邮件、扫描件、共享驱动器和内网网站中。代理程序可以处理这些信息,但前提是必须具备合适的检索架构,并且愿意在信息提取、索引和治理方面进行投入。.
data governance较弱。. 当代理程序能够读取并操作您的 data 环境时,血统、访问控制、驻留和保留策略都变得至关重要。大多数企业都是在代理程序首次做出意料之外的操作时,才发现其治理措施比预想的要薄弱。.
系统集成存在脆弱性。. 老旧的ERP系统、定制API,以及那些从未被设计成可通过编程方式进行查询的系统,都会造成阻力。模型上下文协议(Model Context Protocol)在此方面发挥了重要作用,但大量遗留系统带来的困扰依然存在。.
没有评估或可观测性。. 在供应商的推介中,最大的警示信号就是缺乏评估框架。如果无法衡量该代理是否合适,就无法部署它。我们曾看到一些管理完善的组织忽略了这一点,结果后悔莫及。.
成本和延迟方面的意外情况。. 代币消耗可能会迅速累积。对于处理长上下文、推理密集型任务的代理而言,延迟可能会逐渐加剧,最终导致用户体验受损。这两方面都需要从第一天起就进行监控,而不是等到第四个月才发现问题。.
组织层面的阻碍因素
所有权不明确。. 代理型工作在IT、data和业务部门之间处于一种尴尬的境地。由于缺乏明确指定的负责人,且没有具备打破僵局所需政治权威的推动者,项目要么陷入审批僵局,要么分裂成影子项目。.
激励机制失调。. 人们因当前所做的工作而获得回报。如果某个代理威胁到这项工作,那些最能让该代理发挥作用的人,恰恰也是最有可能阻挠其运作的人。坦率地指出这一点,就等于解决了问题的一半。.
运营模式不匹配。. 大多数企业的组织架构都是围绕具有明确起止点的项目构建的。而代理(Agents)则是需要持续调整、评估和改进的产品。若试图通过项目运营模式来交付代理相关工作,将会导致部署结果脆弱且逐渐失效。.
变更管理债务。. 代理程序部署中最困难的部分并不是构建代理程序本身,而是重新设计围绕代理程序开展的工作。大多数组织尚未投入资源来培养做好这项工作所需的变革能力。.
对流离失所的恐惧。. 当员工担心智能代理是来取代他们时,系统推广就会陷入停滞。我们观察到最成功的部署案例,都是对此明确且令人信服的:智能代理负责处理枯燥的环节,这样员工就能专注于工作中需要发挥判断力的部分。光说是不够的,必须用实际行动来证明。.
评估能力较低。. 那些无法有效评估智能体是否在正常工作的管理层,很容易被那些无法推广到实际场景的演示所打动。建立一套共同的术语体系——包括准确率、精确率、召回率、幻觉率、升级率、每次解决成本等——如今已成为任何负责监督智能体工作的管理层职责的一部分。.
如果非要从高层领导层面挑选两个最值得关注的阻碍因素,那就是技术层面的“data governance”,以及组织层面的运营模式。如果放任不管,无论模型变得多么完善,这些因素都会悄无声息地限制你们所能创造的价值。.
企业级部署的剖析
在任何代理系统投入生产之前,值得思考的一个问题是:当该系统在公众面前出现故障时,需要满足什么条件,我才能感到安心?因为在大规模运行时,代理系统难免会在公众面前出现故障。关键在于确保当故障发生时,你能及时发现、控制并迅速恢复。.
企业级部署需要满足一些不可或缺的基本要求。这些要求单独看或许并不引人注目,但综合起来,它们决定了某项方案是值得你欣然向监管机构说明的,还是你宁愿避而不谈的。.
身份与访问管理。. 每个代理操作都应在特定身份下运行,并继承其所代表用户的权限。那些使用广泛服务账户权限运行的代理,极易导致系统中断,并可能成为审计发现的问题。.
审计日志。. 每一项决策、每次工具调用、每次升级都应被记录在案,且记录不可篡改、可查询。这绝非可选项。金融服务、医疗保健以及越来越多其他受监管行业的监管机构都会提出询问。你希望给出的答案是:“是的,就在这里。”.
评估框架。. 一套标注好的测试集,用于在每次发布前对智能代理进行评估,并明确规定了通过的阈值。这是大多数团队最容易忽视的一项最具价值的投资。如果你的团队无法向你展示他们的评估结果,那就说明他们尚未构建出企业级智能代理。.
可观测性。. 实时掌握代理在生产环境中的运行状况:成功率、延迟、每次请求成本、升级率以及随时间推移的偏差情况。这些指标与您对任何生产服务所期望的指标相同,且已在代理层级进行了监控。.
成本控制。. 按用户、按代理和按租户设置的消耗上限。警报。对失控循环的自动限流。不受控的令牌消耗,对于代理而言,就相当于内存泄漏。.
人工干预检查点。. 涉及重大后果的决策应暂停,以便由人工进行审核,此时系统应提供相关背景信息并提出建议。具体阈值应根据具体用例而定;但阈值的存在本身是不可商榷的。.
Data 治理与居住地。. 就代理商可以读取、写入、保留以及跨境传输哪些data数据制定明确的政策。如果您在欧盟、英国、海湾地区以及其他拥有各自立场的地区开展业务,这一点尤为重要。.
备用行为。. 当模型不可用、响应无法解析或工具调用失败时会发生什么?生产环境中的代理需要支持优雅降级,而不是无声失败或出现意外行为。.
可扩展性模式。. 该架构应能在无需更换平台的情况下,处理100倍于当前发布量的需求。模型间的路由、缓存、异步处理、基于队列的执行:这些都是将分布式系统的标准规范应用于新底层架构的实践。.
这些都不是什么稀奇的问题。在那些仓促构建且从未经过妥善加固的代理系统中,这些问题往往被一再忽视。原型与生产环境之间的差距之所以如此之大,正是因为这份清单所列的问题构成了这一差距。.
部署指南
在过去两年中,我们与客户共同推进的各项代理部署项目中,逐渐形成了一个清晰的五阶段模式。明确命名这一模式,有助于高管们规划预算、设定预期,并在适当的时候安排合适的人员参与其中。.

图5. 能动性部署的五个阶段。.
第一阶段:探索。. 确定候选用例,评估其价值,审核其所需的data,并从中挑选一到两个作为首批试点。这一阶段的关键在于学会“说不”——大多数候选用例尚未准备就绪,而从错误的起点开始是项目失去动力的最常见原因。 参会人员:业务发起人、实际执行工作的操作人员、data负责人。.
第二阶段:原型设计。. 在几天到几周内,针对选定的用例构建一个可运行的端到端智能代理。 在此阶段,可视化构建工具或基于提示的通常是合适的工具。目标是验证该用例在原理上可行,而非构建生产系统。参与人员包括:一个小型开发团队、提供反馈的业务用户,以及就生产化路径提供建议的工程团队。.
第3阶段:强化。. 这是耗时最长、预算最紧缺的阶段。需要构建评估套件、添加访问控制、部署可观测性工具、确定人工干预检查点,并进行生产前测试。大多数企业都会在此阶段停滞不前,因为这项工作既不光鲜,而原型系统看起来已经相当令人印象深刻了。涉及的部门包括:工程、安全、风险与合规、变更管理。.
第4阶段:部署。. 向试点用户推出,密切关注各项指标,并根据实际使用情况进行迭代。制定变更管理计划;对用户进行培训,明确预期,建立反馈机制。大多数部署在全面推广前都需要经过三到六周的仔细监测。相关方:运维、变更管理和人力资源部门,以及最初的业务发起人。.
第5阶段:规模化。. 将智能代理的应用范围扩展至更广泛的人群,提炼可复用的模式和组件,建立能够支持第二、第三和第四类用例的卓越中心。这也正是运营模式问题变得至关重要的环节:组织如何在长期内实际运营这一系列智能代理?参与人员包括:高管赞助人、新兴的人工智能领导团队以及运营模式负责人。.
如今,大多数企业都有几个试点项目处于第2阶段,而处于第4或第5阶段的系统却寥寥无几。在未来两年内,那些能够顺利从第3阶段过渡到第5阶段的企业,将获得远超其他企业的竞争优势。.
短期至中期展望
未来12至36个月内,代理领域将呈现怎样的格局?目前已有四大趋势显现,值得在规划中加以考量。.
多智能体系统已成为处理复杂工作的标准方案。. 如今,多代理技术已成为前沿领域。到2027年,它将成为任何非简单代理工作流的默认架构。协调工具正在迅速成熟,运行多个专用代理的成本现已足够低,以至于“一个大型代理”所带来的工程简便性在成本上已不再具有合理性。 此前已投资于评估框架和可观测性的企业将能够轻松实现向这一架构的扩展。而尚未进行相关投资的企业则将面临困境。.
代理市场和可复用组件。. 当前状况是:每家企业都从头开始构建每个代理,这只是过渡阶段。 我们预计将出现一场重大转变,即向预构建代理和可复用组件的市场化模式迈进,这些组件既包括供应商提供的,也包括企业内部开发的。在大型客户中,类似于私有应用商店的内部平台已经开始涌现。对于高管而言,这改变了“自建还是采购”的抉择,到2027年,这一问题将更趋向于“自建还是组合”的模式。.
基于代理的过程挖掘。. 流程挖掘供应商正在迅速增加智能代理功能,而原生AI流程发现技术则从另一个方向崭露头角。那些能够映射流程、识别机遇,并最终实施相应工作流的组合型智能代理,将成为一个更具意义的类别。对于该领域当前供应商的宣传,请务必谨慎对待;技术发展日新月异,锁定风险确实存在。.
监管趋严。. 《欧盟人工智能法案》中关于高风险系统的要求将分阶段于2026年和2027年陆续生效。英国则采取了更侧重行业分类的监管方式,但金融服务、医疗保健和关键基础设施均在监管范围内。 沙特阿拉伯的SDAIA和阿联酋的人工智能办公室已发布相关框架,这些框架将逐步发展为具有约束力的要求。韩国的《人工智能基本法》已于2026年1月生效。在美国,各州的立法情况呈现出不断变化的、零散的局面。 各行业正通过更新指南作出回应:英国皇家特许测量师学会(RICS)正在更新其针对房地产行业的指南;新加坡金融管理局(MAS)已发布专门针对金融领域人工智能的原则和方法论;保险公司现在在续约时会询问法律和会计事务所是否已制定人工智能使用政策。合规负担正在增加,但合规的具体要求也日益明朗。 请提前做好规划,切勿对此感到措手不及。.
高管们必须深刻领会的一个最重要的战略要点是:基础模型将继续走向商品化。竞争优势不会源于此。 真正的竞争优势将源于:你们能够使用的专有data模型、围绕代理能力重新设计的工作流,以及你们构建的评估基础设施——正是这些让你们能够比竞争对手更快地推出改进方案。现在投资于这三方面的组织将获得复利式增长的优势;而押注于某个特定模型将成为赢家的组织则无法获得这种优势。.
想要等到局势稳定后再行动的冲动是可以理解的。但这样做代价高昂。现在开始行动的成本主要体现在可能犯错上;而等待两年的代价,则是会在结构上落后于那些通过实践积累经验的竞争对手。.
对该标题的审慎回应
那么,回到标题的问题:真的能在几小时内构建一个企业级AI代理吗?
你可以在几小时内构建一个智能代理。几天内就能打造出有用的东西。几周内则能做出真正出色的产品。但要打造企业级系统——那种你愿意向最重要客户、监管机构和董事会展示的系统——即使使用最先进的工具,也需要数月时间的精心打磨。 而这一差距并没有像新闻头条所暗示的那样迅速缩小。相反,随着底层模型能力的提升,“企业级”的门槛也在同步提高,这一差距反而在不断扩大。.
好消息是,了解情况的成本已降至几乎为零。以下是任何高管下周都能采取的三项举措,无需预算审批,无需成立指导委员会,也无需做出任何战略承诺。.
首先,从你自己的工作中挑选一项具有重复性、需要大量判断且边界明确的任务。在 Claude、ChatGPT、Gemini 或 Copilot Studio 中为此构建一个基础智能体。使用它两周时间。在这两周里,你所学到的知识将远超任何数量的幻灯片演示文稿所能提供的。.
其次,根据前面提到的四点启发式原则(重复性、高度依赖判断、范围有限、允许人工审核),对企业中的一项流程进行审核。从中筛选出的流程正是您真正的机遇所在。.
第三,向你的团队提出一个问题:我们的评估框架是什么?如果他们无法给出清晰的回答,那就是你的起点。.
在未来十八个月内,能够做好这一点的公司,不会是那些制作出最精妙演示版本的公司。而是那些迅速且诚实地学会了如何弥合“可运行的智能代理”与“真正有效的智能代理”之间差距的公司。.
案例研究
面向商业房地产分析师的可视化构建器解决方案
Artefact 通过为某企业客户(CRE)的内部分析师团队提供培训、指导和结对编程活动,帮助其在任务代理开发方面实现了战略自主,同时主导交付了三个可运行的任务代理。 代理架构限定在 Claude(基础模型服务)和 Power Automate(编排、内存、工具及安全防护)范围内,从而确保这些代理大致采用内部团队所熟悉且能够与现有技术并行维护的工具生态系统。.
通过这种方式,这些代理被赋予了生产服务的一些属性,但未包含其他属性,包括审计日志、可观测性和可扩展性。 尽管如此,在短时间内,CRE 便整合了简洁而有效的 data governance 和驻留机制、人工干预检查点以及身份与访问管理,同时建立了基础的评估管道和管理流程——这使其走上了实现显著效率提升的轨道。.
面向一家全球私募股权公司的流程代理创新
Artefact 开发了一个基于 Claude ‘Skills’ 实现的工作流代理原型,并将其演进为高性能的 Claude ‘Connector’,这体现了利用 MCP 从仅用自然语言定义 AI 任务,转向将任务定义为高性能 AI 工具组合的过程。 该解决方案之所以被称为“工作流代理”而非单纯的“任务代理”,其关键区别在于:除了调用辅助大语言模型(LLM)来执行工具操作外,还应用了一个主大语言模型来管理工具调用的顺序。.
在现有 Azure 架构中引入 Claude Connector 模式,产生了一项支持网络入站流量和 data 访问的新需求。在那些已成功将此类通用基础设施作为共享服务进行管理的组织中,我们发现每次新服务上线时,新生产服务的部署时间最多可缩短至原来的三分之一。.
克里斯-德-格鲁本 现任Artefact公司高级总监,负责领导该公司在英国和欧盟的房地产业务。他广泛与英国、欧洲及海湾地区的公共和私营部门客户开展合作。.
奥利弗·理查森 是 Artefact 的高级机器学习经理,20 多年来一直致力于协助金融、商业和政府领域的各类组织部署最先进的人工智能/机器学习产品。.
Artefact 我们与企业合作,从首次试点到企业级部署,全面设计、构建和运营大规模人工智能系统。如果您目前正面临原型与生产环境之间的衔接难题,我们很乐意与您交流经验。.

博客







