Skip to content

Q93 · 多智能体模式(Multi-Agent Pattern) ​

用户问一个客服助手:“X1 手表能戴着游泳吗?如果进水,免费维修吗?”这是一句话,却包含两个需要分别查证的问题:能否浸水使用要看产品说明书,进水是否保修要看售后政策。两个问题可以同时查,最后再合成一份答复。但若只让两名助手各说一句就拼起来,可能会把过期广告里的“防水”与现行保修条款混成自相矛盾的承诺。

多智能体模式(Multi-Agent Pattern)让一个协调者负责理解目标、划分工作、收集结果和决定最终答复;多个执行者在各自限定的范围内搜索、判断并带回证据。它适合能分成相对独立探索方向、又需要统一综合的任务。把一个简单问题拆成许多 Agent 不会天然更准,还可能增加调用费、延迟和协调错误。Anthropic 的多 Agent 研究系统实践也明确记录了并行探索的收益、令牌开销,以及重复搜索和协调失败的代价。

协调者将 X1 手表问题交给产品与保修执行者,汇合两份证据后答复

术语与本例假设 ​

词或符号在本文中的含义
大语言模型根据输入生成文字或选择下一步操作的模型;它写出的结论仍需证据支持。
Agent以目标为导向、能根据中途发现选择下一步查询或工具的应用单元。本文的执行者都可自行决定查哪一段、是否补查,然后返回结果。
多 Agent多个这样的应用单元在一个任务中分工协作。若程序只并行调用两个固定接口,没有让执行者自主查找或判断下一步,那只是并行工具调用。
协调者 / 执行者协调者负责拆解目标、设边界、汇总和停机;执行者只负责指定子问题,返回发现、依据与不确定点。也常称主 Agent 与子 Agent。
子任务 / 委派子任务是能单独完成的一部分工作;委派是协调者把目标、范围、可用资料、输出格式和时限交给执行者。
并行 / 汇合并行是两名执行者在同一阶段同时工作;汇合是等待并检查结果后才形成最终答复。并行不保证更快,最慢的必要分支仍会拖住汇合。
共享事实 / 证据卡两名执行者共同遵守的任务事实,例如产品型号和文档版本;证据卡是执行者返回的“结论、原文位置、版本、可信状态”,供协调者核查。
冲突两份资料或两个执行者得出不能同时成立的结论,例如广告说“可游泳”,现行说明书说“不能浸水”。这需要查版本与适用范围,不能投票决定。
上下文 / Token上下文是一次模型调用能看到的任务材料;Token 是模型计量文本的基本单位。多个执行者各自读文档、对话和搜索结果,会增加总 Token 消耗。
X1、M3、P2虚构手表型号、现行产品说明书版本、现行保修政策版本;不是现实产品或保修规则。

例子假设:X1 是虚构手表。当前生效的 M3 说明书写明“IPX4,适用于日常溅水,不得浸入水中或游泳佩戴”;当前生效的 P2 保修政策写明“液体进入设备造成的损坏不属于免费维修范围,具体故障须检测确认”。一张过期宣传页 A1 曾写“运动防水”,但未定义游泳条件。例子只演示信息答复,不代表现实中的 IP 等级解释或消费者权益结论;实际产品须看其正式测试范围、适用地区条款和现行法律。

协调者怎样把任务交出去 ​

协调者先把原问题拆成两个可独立查证的子任务,并给双方同一份基本事实:产品型号 X1、用户问的是游泳佩戴与进水后的免费维修,应使用当前有效版本、不得依据广告口号推断。它不能只写“你查产品、你查保修”,因为执行者可能查不同型号、地区或历史版本。Anthropic 在其研究系统中发现,含糊委派会导致子 Agent 重复工作或遗漏重要方向;给清楚的目标、来源范围、输出格式与边界更稳妥。来源

谁负责接收的工作应返回什么
产品执行者查 X1 的现行说明书,回答“能否游泳佩戴”;若看到广告与说明书不一致,要标出。“不能据 M3 允许游泳;M3 使用限制原文位置;A1 与 M3 冲突,A1 已过期。”
保修执行者查适用于 X1 的现行 P2,回答“进水能否免费修”;不擅自判断用户设备的具体故障原因。“液体进入造成的损坏不属免费维修;须检测确认是否确属进水损坏;P2 条款位置。”
协调者检查双方是否回答完整、来源是否同一产品和有效版本;处理冲突与缺口;形成一份答复。清楚回答两个问题,逐项给依据和必要限制。

“证据卡”可以理解为四个字段:claim 是要告诉用户的结论;source 是文档和条款位置;version 是资料版本和生效信息;uncertainty 是还不能确定的部分。例如产品执行者的卡片是 claim=不建议也不支持游泳佩戴、source=M3 使用限制、version=M3 当前有效、uncertainty=旧广告 A1 表述模糊且已过期。这是教学结构,不依赖某个框架的固定类名。协调者需要拿得到原文或可信引用,不能只相信执行者浓缩后的句子。

两个执行者可以在同一时间查资料:产品执行者发现 A1 的“运动防水”后继续找 M3 的具体使用限制;保修执行者发现条款有“检测确认”的前提后继续核对该条是否适用于 X1。各自的查询路径会随结果变化,因此它们是带工具循环的 Agent;如果数据库已有两个准确字段,直接并行查询字段通常更简单。

汇合时先核对事实,再写答案 ​

协调者收到两张证据卡后做三次核对。第一,对象相同:两张卡都谈 X1,不是另一个型号。第二,版本有效:使用 M3 与 P2 的现行条款,并把 A1 标为过期资料。第三,结论边界清楚:说明书只支持日常溅水,不能由“IPX4”推成“可以游泳”;保修条款说液体进入造成的损坏不免费修,但是否确属这种损坏要检测,不应宣布用户设备已被拒保。

正常完成时,协调者的回答可以是:

“按 X1 现行说明书 M3,它只说明日常溅水场景,并明确不支持浸水或游泳佩戴。按当前保修政策 P2,若检测确认故障由液体进入造成,该损坏不属于免费维修;您这台设备的故障原因仍需检测,不能仅凭描述判定。过期宣传页上的‘运动防水’不能替代现行说明书的使用限制。”

这里没有让两个执行者“投票”决定真假,也没有把“不给免费修”偷换成“不提供维修”。最后答复是协调者重新查证、限定范围后的合成结果,不是把两段自然语言机械拼接。Anthropic 将“协调者动态拆任务、工作者执行、协调者综合”称为 orchestrator-workers;这与任务固定、只同时发两个请求的并行流程有联系,但自主拆解程度不同。来源

资料冲突和执行失败怎么办 ​

如果产品执行者只找到 A1,回答“能游泳”,而保修执行者找到 P2,回答“进水不保”,协调者应暂停“能游泳”这项结论。它先要求产品执行者补查正式说明书与生效版本,再按来源和适用条件判断;若仍无法确认,应把“能否游泳”标为待核实,交产品团队或人工客服,不应使用多数票或凭协调者自己的猜测填补。共享事实应是经过核对的型号、地区、文档版本与原文位置,不是多个 Agent 互相转述后共同相信的句子。

另一种失败是保修执行者超时。协调者已拿到 M3,可以在界面允许部分答复时先说“按说明书不能游泳佩戴,保修问题正在核对”,同时保留问题状态;若系统要求一次完整答复,则延迟发送、有限次重试或转人工。不得把“子 Agent 没返回”解释成“进水肯定保修”或“肯定不保”。重试要有时限与次数,避免一个卡住的执行者让所有请求长期等待。Anthropic 的多 Agent 实践指出,等待慢子 Agent 的同步执行会形成瓶颈,异步协调虽然可改善等待,也带来结果一致性和错误传播问题。来源

如果执行者拥有写工具,边界还要更严格:只给它完成子任务必需的权限;多个执行者不能同时对同一订单执行退款、发信或改状态。写操作应有统一审批、幂等控制和可审计记录。本文两名执行者仅只读查资料,因此可以并行;用户的问题本身也不授权系统执行维修申请。

多一个 Agent 的成本是否值得 ​

并行可能缩短墙上时钟等待时间:两段互不依赖的查询若分别耗时 T产品 与 T保修,理想情况下查询阶段接近两者较大值,再加协调者分工与汇总的时间。但如果两段必须互相等待,或者一个分支反复补查,实际时间会更长。总费用也不会因为并行而变少,至少要支付协调者和两个执行者各自读材料、搜索和生成的 Token 与工具调用成本;资料复制、重复搜索和冲突复查还会增加支出。

Anthropic 报告其研究系统在宽度优先、可并行探索的内部研究任务中获得明显收益,同时指出其多 Agent 系统消耗的 Token 显著高于普通聊天,而且共享上下文要求高、依赖关系多的工作不适合随意并行。研究系统工程复盘 这些是特定系统与评测的经验,不能推成“多 Agent 对所有任务都更准”。上线前应在相同题目集上比较单 Agent、固定双路查询与多 Agent:看答复事实正确率、证据可追溯率、冲突漏报率、平均与高位延迟、每题费用、人工接管率。如果简单方案已经可靠,增加协调层的收益可能抵不过成本。

选择多个 Agent 时,我会看三个条件:问题能否拆成低依赖的独立探索;不同执行者是否有明确的资料范围或技能;协调者能否依据原始证据判定冲突并停止。缺任一条件,先用单 Agent 或确定性工作流。即便条件满足,也要限制执行者数量、工具调用与总时间,以防“为了显得聪明”无限扩张任务。

面试时怎么回答 ​

多智能体模式是让一个协调者按任务需要分出若干子问题,让执行者在各自范围内用工具探索,再由协调者核对证据、处理冲突并合成结果。比如用户问 X1 手表能否游泳、进水是否免费维修,产品执行者查现行说明书,保修执行者查现行政策;两者都返回结论、来源、版本和不确定点,协调者再统一答复。它适合相互独立且有足够工作量的探索,并行能缩短部分等待,但会增加 Token、协调和失败处理成本。若两个结果冲突,我会先核对型号、文档版本与原文,不靠投票;某个执行者超时就有限重试、部分答复或转人工,不编造缺失结论。最后用同一题目集对比单 Agent 和多 Agent 的准确率、引用质量、延迟与费用,只有收益覆盖成本才采用。

面试官若追问“为什么不直接并行调用两个搜索接口”,可以回答:若输入和查询路径都固定,直接调用接口更可控。 这里的执行者会根据发现决定继续查哪个版本、哪些条款以及如何处理模糊资料,协调者也可随问题动态增减子任务;这才是多 Agent 带来的灵活性,同时也是需要额外控制的原因。若追问“多个 Agent 互相确认是否等于事实验证”,答案是不能:同源资料可能一起错,仍要核对独立的原始文档、版本和适用条件。

资料依据 ​

最后更新2026-09-26
难度P1
频率high
阅读18 min
主题agent / multi-agent / orchestration
觉得有帮助?把这个链接转给正在求职的朋友 · 用 Ctrl + K 全站搜索其它题