How we built our multi-agent research system
这是一篇 Anthropic 于 2025-06-13 发布的工程复盘,介绍他们如何把 Claude 的 Research 功能做成一个可上线的多智能体研究系统。文章的重点不是“多开几个 agent”,而是解释为什么研究任务适合多智能体、这种系统为什么有效、以及从 prototype 走到 production 时 prompt、tool、eval 和可靠性分别会遇到什么问题。
- Anthropic 把这套系统建成了典型的
orchestrator-worker结构:一个 lead agent 负责规划和综合,多个 subagent 并行搜索不同方向,最后再交给 citation agent 做引用定位。 - 这篇文章对“为什么多智能体有效”的解释很直接:研究任务本身就是开放式、路径依赖且需要不断 pivot 的,所以一条线性 pipeline 很难覆盖足够广的探索路径。
- subagent 的价值不只在并行,还在上下文隔离。不同 subagent 用自己的 context window 探索不同方向,再把压缩后的发现交回 lead agent,相当于把总 reasoning capacity 水平扩展了。
- Anthropic 给出了一个非常强的经验结论:在他们的内部 research eval 上,
Claude Opus 4作为 lead agent、Claude Sonnet 4作为 subagents 的多智能体系统,比单 agentClaude Opus 4高90.2%。 - 他们还分析了 BrowseComp 风格任务的性能驱动因素,发现
95%的性能方差可由三项因素解释:token 使用量、tool call 数量和 model choice,其中 token 使用量单独解释了80%。 - 这意味着多智能体系统的本质之一,是把更多 token 和更多并行 context 真正花到问题上,而不是只靠“更聪明的单个 agent”。
- 但代价也非常明确:普通 agent 大约消耗 chat 的
4xtoken,多智能体系统大约消耗 chat 的15xtoken,因此只适合高价值、高并行度的任务。 - 文章给出的 prompt 经验很具体,包括:先学会站在 agent 角度看失败模式、教 orchestrator 正确委派、给不同复杂度任务明确 effort budget、先宽搜再窄搜、以及把 thinking / interleaved thinking 当可控 scratchpad 使用。
- 工具设计仍然是核心变量。Anthropic 明确要求 agent 先看全部工具,再根据用户意图匹配工具,并优先用专用工具而不是泛化工具。
- 这篇文章还把“agent 改进 agent”说得更实:他们用 Claude 4 去分析 prompt 失败模式、重写工具描述,甚至做了一个专门测试 MCP 工具的人造 agent;优化后,后续 agent 的任务完成时间下降了
40%。 - 在评测部分,文章强调多智能体系统不能按固定路径评,因为不同 agent 会走不同但仍合理的路线。因此更适合看 outcome 是否正确、过程是否合理,而不是检查它有没有走预设脚本。
- 他们建议一开始就用小样本 eval 快速迭代,不要等完整大 benchmark;并且在自由文本任务上广泛使用
LLM-as-judge,同时保留人工测试去抓自动化看不到的偏差与异常。 - 到 production 阶段,问题又变成 statefulness:agent 长时间运行、出错会级联、不能轻易重启,因此需要 durable execution、checkpoint、retry 和 resume 机制。
- 文章也强调 observability 和 deployment。多智能体系统具有非确定性和涌现行为,因此不仅要 trace tool call,还要观察 agent 的决策模式和交互结构;部署时则要用 rainbow deployment 这类方式,避免中途升级打断运行中的 agent。
ℹ️ Conflict:
- 多智能体 research 系统在研究场景里很强,但文中也明确指出这不自动推广到 coding 等任务;很多编程任务并没有足够多真正可并行的子问题。
- 性能提升和 token 开销是强绑定的,因此“多智能体更强”常常也意味着“多智能体更贵”,不适合低价值、低并行度需求。
- 目前 Anthropic 的 lead agent 仍然同步等待 subagents 完成,这降低了协调复杂度,但也会形成瓶颈;异步化可能进一步提效,但会显著增加一致性和错误传播难题。
- Multi-agent research systems
- Agent teams
- Evaluation harness
- Tool ergonomics for agents
- BrowseComp
- Anthropic
- Agentic engineering
- Anthropic, “How we built our multi-agent research system”, 2025-06-13.
- 原文摘录:[llm-wiki/raw/anthropic/How we built our multi-agent research system](/raw/anthropic/How we built our multi-agent research system.md)