Claude 3.5 Sonnet
Claude 3.5 Sonnet 是 Anthropic 在该文中讨论的核心模型对象。文章描述的是“升级版” Claude 3.5 Sonnet 与一个轻量 Agent scaffold 组合后,在 SWE-bench Verified 上达到 49%。
- 文章声称升级版 Claude 3.5 Sonnet 在该 benchmark 上超过当时前一最佳结果 45%。
- 其优势不只表现为编码能力,还包括更强的自我纠错、尝试多种解法、在长交互中持续推进问题。
- 文中使用的脚手架很简洁:提示词 + Bash 工具 + 编辑工具。
- 文章同时提示,这个结果依赖具体 scaffold 和评测环境,不能简单等同于“裸模型能力”。
ℹ️ Conflict:
- 49% 是该文发布时间 2025-01-06 的报告值;后续版本、不同 harness 或新 benchmark 结果可能更高或不可直接比较。
- Anthropic
- [llm-wiki/raw/anthropic/Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet](/raw/anthropic/Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet.md)
- SWE-bench Verified
- Agent scaffold
- Agentic coding evals
- Anthropic Engineering, “Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet”, 2025-01-06: https://www.anthropic.com/engineering/swe-bench-sonnet
- 中文翻译:用 Claude 3.5 Sonnet 提升 SWE-bench Verified 的标准