Multi-Agent System—— 多智能体系统
引言:从“超级个体”到“专家团队”
在前面几篇文章中,我们讨论了一个Agent如何思考、如何调用工具、如何记忆、如何与其他Agent通信。然而,单个Agent的能力终究是有限的——无论模型多么强大,单一智能体在处理复杂任务时都会遇到瓶颈。
Anthropic的研究数据表明,当单个智能体挂载超过10-15个工具后,性能就会出现断崖式下跌。而企业级系统动辄需要上百个功能接口,单Agent架构根本撑不住。更不用说,当任务涉及多个专业领域、需要并行处理大量信息时,单Agent的局限性更加明显。
多智能体系统(Multi-Agent System, MAS) 正是为此而生。它不是简单地把多个LLM堆在一起,而是一种分布式自主决策系统。想象一个急诊室:分诊护士、主治医生、检验师、药剂师各自专业,通过标准化流程协作救人。
本文将系统讲解多Agent协作的核心理念、三大协作模式、决策协议机制,以及多智能体辩论(MAD)和Mixture-of-Agents(MoA)两大前沿技术。
一、核心理念——为什么需要多Agent
1.1 单Agent的极限
在深入多Agent之前,有必要先理解单Agent为什么会在复杂任务面前失效。核心原因有两个:
指令迷雾(Instruction Fog) :当提示词越来越长、任务越来越复杂时,模型开始“丢指令”——早期给出的约束条件被遗忘,关键规则被忽略。
工具过载(Tool Overload) :当可选工具太多时,模型的选择准确率急剧下降。一个原本在5个工具上表现完美的Agent,在50个工具面前可能变成一个“选择困难症患者”。
1.2 多Agent的核心逻辑
多智能体系统的核心理念可以用一句话概括:通过角色分工和协作,将复杂任务分解为多个专业Agent各自擅长的子任务。
从数学角度看,多Agent系统将一个复杂的目标函数 G 分解为多个子目标,由不同专业Agent分别求解:
G=⋃i=1ngi,其中Agenti负责求解 gi
每个Agent i 在自己的专业领域内求解:
ai∗=argmaxaPi(a∣contexti)
最终的全局解是所有Agent输出的聚合或组合:
A∗=Aggregate(a1∗,a2∗,...,an∗)
多Agent架构的核心优势在于分工和协作。正如一篇2025年的综述所指出的,基于LLM的多智能体系统使一群智能Agent能够协同解决复杂任务,实现了从孤立模型到以协作为中心的范式的转变。
1.3 关键组件分层
一个成熟的多Agent系统包含四个关键层次:
- Agent运行时(Agent Runtime) :每个Agent的独立沙箱,包含LLM、工具集、记忆体
- 通信总线(Communication Bus) :标准化消息格式、信道加密与路由
- 编排引擎(Orchestration Engine) :任务分解、Agent分配、结果聚合
- 观察者(Observer) :监控Agent状态、检测死锁、触发熔断
二、三大协作模式
根据决策的集中化程度和通信方式,多Agent协作可以归纳为三种基本模式。
2.1 模式一:顺序流水线接力(Sequential Pipeline)
核心思想:Agent串联排列,A处理完传给B,B处理完传给C。
这是最简单的多Agent协作模式,类似于工厂流水线——一个人装车门,下一个人喷漆。在LLM-based MAS中,专门化的Agent按照预定义顺序协作,分别扮演规划、开发、测试等角色。
数学建模:顺序流水线可以形式化为一个函数复合:
y=fn∘fn−1∘...∘f1(x)
其中 fi 是第 i 个Agent的转换函数,x 是输入,y 是最终输出。
优缺点:
- 优点:可预测性高、调试方便——链条断在哪一眼就能看出来
- 缺点:完全没有弹性——下游Agent发现上游出错了也无法退回重做
典型应用:博客生成流水线——研究员Agent找素材 → 写作Agent出草稿 → 编辑Agent审校;SQL生成流水线——SQL生成器 → SQL评分器。
2.2 模式二:层级委托(Hierarchical Leader-Worker)
核心思想:顶层有一个“经理”Agent(Supervisor/Leader),不干具体活儿,只负责拆解任务、分配给下面的“工人”Agent。
层级架构通过顶层规划器将子任务委托给工作Agent,提高了可靠性。在这种架构中,Agent被分为领导者和追随者——领导者执行计算密集型的规划和控制,追随者使用轻量级规则跟踪各自的领导者。
数学建模:设经理Agent的策略为 πmanager,它将目标 G 分解为子任务 (g1,...,gn) 并分配给工人Agent:
(g1,...,gn)∼πmanager(G)
每个工人Agent i 独立求解:
ai=argmaxaPi(a∣gi)
经理Agent负责聚合结果:
A=Aggregate(a1,...,an)
优缺点:
- 优点:能应对复杂多变的目标,分工清晰
- 缺点:经理Agent是单点故障——经理判断错了,整个团队跟着错
典型应用:旅行规划器——经理Agent调度机票专家、酒店专家、本地游专家协同生成行程。
2.3 模式三:对等协商(Peer-to-Peer Negotiation)
核心思想:所有Agent处于同一层级,通过点对点消息传递进行动态协商。
在对等架构中,Agent之间没有明确的上下级关系,而是通过去中心化的协商达成共识。A2A协议正是这种模式的典型代表——它被业界描述为“缺失的对等层,将孤立的bot转变为协作的多Agent系统”。
数学建模:对等协商可以建模为一个分布式约束满足问题。每个Agent i 有自己的局部目标 gi 和行动空间 Ai。协商过程通过多轮消息传递,逐步缩小分歧:
ai(t+1)=argmaxa∈AiPi(a∣messages from other agents at round t)
最终通过共识或投票达成集体决策。
优缺点:
- 优点:无单点故障、弹性扩展能力强、适应动态环境
- 缺点:决策延迟高(需要达成共识)、调试困难(分布式追踪)
典型应用:动态环境下的任务分配、去中心化的多Agent协作网络。
2.4 三种模式的对比
| 维度 | 顺序流水线 | 层级委托 | 对等协商 |
|---|---|---|---|
| 决策集中度 | 最高(固定顺序) | 中(经理决策) | 最低(分布式) |
| 通信方式 | 单向传递 | 上下级指令 | 点对点消息 |
| 决策延迟 | 低 | 低-中 | 高(需共识) |
| 容错能力 | 差(单点断链) | 中(经理单点) | 高(无单点) |
| 适用场景 | 流程固定、时效敏感 | 复杂目标、需分工 | 动态环境、弹性扩展 |
| 代表框架 | 顺序编排器 | CrewAI | AutoGen v0.4+ |
三、决策协议——从“讨论”到“决定”
协作模式的差异决定了Agent之间“怎么聊”,而决策协议(Decision Protocol) 决定了“聊完之后怎么办”——多个Agent产生了不同的意见,如何形成一个最终的、一致的决策?
这是多Agent系统中最关键的环节之一。2025年ACL的一篇系统研究评估了七种决策协议对多Agent辩论的影响,揭示了不同协议在不同任务类型上的表现差异。
3.1 协议一:投票(Voting)
核心思想:每个Agent独立给出答案或偏好,通过多数原则(如超过50%)形成最终决策。
在数学上,投票可以表示为:
A∗=argmaxa∑i=1nwi⋅1[ai=a]
其中 wi 是Agent i 的投票权重(可以基于历史准确率动态调整),1[⋅] 是指示函数。
表现数据:投票协议在推理任务上表现优异,相比其他决策协议提升了13.2% 的性能。
适用场景:逻辑推理、数学问题、代码生成等“有明确正确答案”的任务。
3.2 协议二:共识(Consensus)
核心思想:所有Agent通过多轮讨论和协商,达成一致同意的决策。
共识协议更强调集体讨论和互动,通过多轮审议让所有Agent的意见趋于一致。与投票不同,共识不满足于“多数同意”,而是追求“全体同意”或“近乎全体同意”。
表现数据:共识协议在知识任务上表现更好,相比其他决策协议提升了2.8% 。
适用场景:知识密集型任务、需要综合多方意见的开放性问答题。
3.3 协议三:法官裁决(Judge / Adjudicator)
核心思想:引入一个独立的“法官”Agent(或人类),听取各方辩论后做出最终裁决。
法官裁决借鉴了司法审判的流程——多个Agent扮演不同角色(如控方、辩方、专家证人),通过辩论呈现各自的论据,法官基于这些论据做出最终判断。
数学建模:设法官的策略为 πjudge,其输入是所有Agent的论据 {a1,...,an} 和辩论历史 H:
A∗∼πjudge(a1,...,an,H)
适用场景:高 stakes 决策(如法律判断、医疗诊断)、需要“第三方仲裁”的争议场景。
3.4 协议选择指南:任务适配性
| 决策协议 | 最佳任务类型 | 表现提升 | 关键特征 |
|---|---|---|---|
| 投票 | 推理任务 | +13.2% | 快速、适合有明确答案的问题 |
| 共识 | 知识任务 | +2.8% | 适合需要综合多方知识的开放问题 |
| 法官裁决 | 争议性决策 | 视情况 | 适合高 stakes、需要仲裁的场景 |
值得特别注意的是,增加Agent数量通常会提升性能,但增加讨论轮次反而可能降低性能。这意味着在多Agent辩论中,“聊太久”可能适得其反——更多的讨论不一定会带来更好的决策。
四、多智能体辩论(MAD)——当Agent开始“吵架”
4.1 什么是MAD
多智能体辩论(Multi-Agent Debate, MAD) 是一种让多个Agent通过结构化的“针锋相对”式辩论来共同求解问题的框架。多个Agent各自提出论点、反驳对方、修正自己的立场,通过多轮交互逐步逼近正确答案。
MAD的核心假设是:辩论过程本身能够提升集体智能——通过思想的碰撞和交锋,Agent能够发现自己推理中的盲点,从而得出更可靠的结论。
4.2 MAD的数学建模
MAD可以形式化为一个多轮交互过程。设共有 n 个Agent,在第 t 轮,Agent i 的输出为:
ai(t)=LLMi(prompt,a1(t−1),...,an(t−1))
即每个Agent在每一轮都能看到其他Agent上一轮的观点,并据此调整自己的立场。
经过 T 轮辩论后,通过决策协议(通常是多数投票)得出最终答案:
A∗=Vote(a1(T),...,an(T))
4.3 MAD的真实效果:一个颠覆性的发现
然而,2025年NeurIPS的一篇重要研究对MAD的有效性提出了根本性质疑。
研究者将MAD拆解为两个核心组件——多数投票和Agent间辩论——分别评估它们的贡献。结果令人惊讶:多数投票单独就能解释MAD的大部分性能提升,而辩论本身并没有显著提升预期的正确性。
更深入的理论分析表明,辩论过程可以建模为一个随机过程,它诱导了Agent信念轨迹上的鞅(Martingale) ,这意味着辩论本身并不会改善预期的正确性。
简单来说:让一群Agent各自独立回答问题然后投票,效果并不比让它们先吵一架再投票差——甚至可能更好。
另一项2025年的研究也得出了类似的结论:多数投票在多数情况下是最佳策略。研究者甚至提出了一个更尖锐的问题:“如果多Agent辩论是答案,那么问题是什么?”
4.4 对实践的启示
这些发现并不意味着MAD没有价值,而是提示我们:
- 投票是核心:在多Agent系统中,多数投票是最简单、最可靠的决策机制
- 辩论要适度:过多的讨论轮次不仅增加成本,还可能降低性能
- 模型多样性很重要:有研究表明,模型异质性可以显著提升MAD框架的效果
- 简单集成往往更可靠:在大多数实际场景中,简单的集成方法比复杂的辩论框架更可靠
五、Mixture-of-Agents(MoA)——让多个模型“投票”
5.1 从Mixture-of-Experts到Mixture-of-Agents
Mixture-of-Agents(MoA) 受混合专家(Mixture-of-Experts) 范式的启发,是一种通过聚合多个不同LLM的输出来提升整体性能的集成方法。
与MAD强调“辩论”不同,MoA更强调 “多样性集成” ——让多个不同的模型(或同一模型的不同配置)各自生成答案,然后通过一个聚合器整合出最终结果。
5.2 MoA的架构
一个典型的MoA系统包含两层结构:
第一层(提案层) :多个不同的LLM(如GPT-4、Claude、Llama等)各自独立生成答案。这些模型可以是:
- 不同供应商的模型
- 同一模型的不同温度采样
- 不同微调版本的模型
第二层(聚合层) :一个“聚合器”模型接收所有提案,综合生成最终答案。
数学上,MoA可以表示为:
proposals={LLMi(prompt)}i=1n
A∗=Aggregator(prompt,proposals)
5.3 MoA的效果数据
MoA的效果令人印象深刻。在一项医疗问答摘要任务中:
- 2层MoA配置将LLaMA的性能提升了28% (从0.28到0.51)
- 对于基于视角的摘要任务,2层MoA将LLaMA性能提升了32% (从0.28到0.37)
2025年ACL上提出的残差MoA(RMoA) 进一步优化了这一范式,受ResNet残差学习的启发,集成了残差连接来优化效率和可靠性,在数学推理、代码生成和多任务理解等多个基准上达到了SOTA性能,同时显著降低了计算开销。
5.4 MoA vs MAD:两种集成哲学的对比
| 维度 | MAD(多智能体辩论) | MoA(混合智能体) |
|---|---|---|
| 核心机制 | 多轮辩论 + 投票 | 多模型独立生成 + 聚合 |
| Agent间交互 | 强(多轮相互影响) | 弱(独立生成,仅最后聚合) |
| 计算成本 | 高(多轮) | 中(单轮 + 聚合) |
| 主要驱动力 | 辩论过程 | 模型多样性 |
| 理论基础 | 辩论提升推理 | 集成提升鲁棒性 |
| 关键发现 | 辩论本身贡献有限 | 多样性是关键 |
一个值得注意的发现是:用同一顶级模型多次采样(不同温度)可能比混合不同模型效果更好。Self-MoA方法显示,单个模型多次采样比标准MoA提升了6.6% 。这说明,多样性比“不同供应商”更重要——即使是同一个模型,不同的随机种子也能带来有价值的多样性。
六、总结:多Agent协作的决策树
多Agent协作的本质,是在分工和集成两个维度上做设计选择。
在分工维度(怎么组织Agent):
- 任务线性、步骤固定 → 顺序流水线
- 任务复杂、需专业分工 → 层级委托
- 任务动态、需弹性扩展 → 对等协商
在集成维度(怎么形成最终决策):
- 有明确正确答案 → 投票(推理任务提升13.2%)
- 需综合多方知识 → 共识(知识任务提升2.8%)
- 高 stakes 需仲裁 → 法官裁决
在实现方式维度(怎么让多个Agent协作):
- 强调辩论交互 → MAD(但注意辩论本身贡献有限)
- 强调模型多样性 → MoA(多样性是关键,2层可提升28%+)
这三个维度的组合,构成了多Agent系统设计的决策空间。正如一篇2025年的综述所总结的:基于LLM的多智能体系统使智能Agent群体能够协同解决复杂任务,实现了从孤立模型到以协作为中心的范式的转变。而多Agent协作本质上是一种更高级的 “上下文工程” ——通过任务分解和角色分工,巧妙地绕过了当前大模型的技术瓶颈。
在实际落地中,从简单开始——先用投票式的多数集成,再根据任务复杂度逐步引入分工和辩论。正如NeurIPS 2025那篇论文的结论所提醒的:“简单的集成方法在大多数实际场景中仍然是更强大、更可靠的选择”。
Some information may be outdated