跳转到内容

Claude 3.5 Sonnet

Claude 3.5 Sonnet 是 Anthropic 在该文中讨论的核心模型对象。文章描述的是“升级版” Claude 3.5 Sonnet 与一个轻量 Agent scaffold 组合后,在 SWE-bench Verified 上达到 49%。

  • 文章声称升级版 Claude 3.5 Sonnet 在该 benchmark 上超过当时前一最佳结果 45%。
  • 其优势不只表现为编码能力,还包括更强的自我纠错、尝试多种解法、在长交互中持续推进问题。
  • 文中使用的脚手架很简洁:提示词 + Bash 工具 + 编辑工具。
  • 文章同时提示,这个结果依赖具体 scaffold 和评测环境,不能简单等同于“裸模型能力”。

ℹ️ Conflict:

  • 49% 是该文发布时间 2025-01-06 的报告值;后续版本、不同 harness 或新 benchmark 结果可能更高或不可直接比较。