Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet
这是一篇 Anthropic 于 2025-01-06 发布的工程文章,核心结论是:升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得 49%,以一个尽量简洁的 agent scaffold 超过当时 45% 的前一最佳结果。文章重点不只是分数本身,而是说明 benchmark 成绩来自“模型 + 工具 + 交互循环”的系统设计。
- SWE-bench Verified 被定义为 SWE-bench 的 500 题人工校验子集,用来更清晰地衡量 agentic coding 能力。
- 文章强调 benchmark 测的是完整 agent,而不是孤立模型;同一模型在不同 scaffold 下成绩可以明显不同。
- Anthropic 采用“最小脚手架”思路:一个提示词、一个 Bash 工具、一个编辑工具,让模型自己决定探索、复现、修改和验证路径。
- 工具接口设计被视为关键能力来源,包括:绝对路径约束、详细工具说明、基于字符串替换的编辑方式、持久化状态。
- 文中展示的推荐工作流是:浏览仓库、写复现脚本、运行复现、修改源码、重新验证、检查边界情况。
- 文章给出的分数对比为:新版 Claude 3.5 Sonnet 49%,前 SOTA 45%,旧版 Claude 3.5 Sonnet 33%,Claude 3 Opus 22%。
- 文末指出四类主要挑战:长时运行和 token 成本、评分与环境噪声、隐藏测试、多模态文件不可见。
ℹ️ Conflict:
- “49% 并超过前 SOTA 45%”是文章发布日 2025-01-06 的时点结论,不应默认代表后续时间点的最新 leaderboard。
- Anthropic Engineering, “Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet”, 2025-01-06: https://www.anthropic.com/engineering/swe-bench-sonnet
- 原文摘录:[llm-wiki/raw/anthropic/Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet](/raw/anthropic/Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet.md)
- 中文翻译:用 Claude 3.5 Sonnet 提升 SWE-bench Verified 的标准