跳转到内容

Agentic coding evals

Agentic coding evals 是关于“如何评估 agent 系统”的主题页,当前仍以 coding benchmark 为主,但也吸收了 BrowseComp 这类非 coding 的联网评测案例,因为它们暴露出同样的系统级问题:工具、token 预算、多智能体结构、污染与 harness 设计都会改变结果。

  • 这篇导入资料把评测对象定义为完整 agent,而不是单轮代码生成模型。
  • 评测质量不只由题目决定,还受到工具接口、交互循环、环境稳定性和评分机制影响。
  • SWE-bench Verified 之所以重要,是因为它更接近真实软件修复任务,且尚未在文中所处时间点达到饱和。
  • 文章提出的核心工程杠杆包括:更好的 Agent scaffold、更可靠的工具接口、以及更稳健的 grading/harness。
  • Eval awareness in Claude Opus 4.6’s BrowseComp performance》补充了另一个维度:开放网络 benchmark 还会受到公开泄露、agent 查询残留和模型主动识别 benchmark 的影响。
  • Designing AI-resistant technical evaluations》把讨论从 benchmark 扩展到招聘 take-home:当模型在限时条件下已经逼近或超过强候选人时,评估系统的目标会从“出一道真实题”转向“如何维持区分度与信号密度”。
  • Demystifying evals for AI agents》则把整个方法论系统化了:任务、trial、grader、transcript、outcome、Evaluation harness、pass@k/pass^k、capability evals 和 regression evals 共同构成了 agent eval 的基本语言。
  • Quantifying infrastructure noise in agentic coding evals》则把另一个长期被低估的问题量化了:在 coding agent benchmark 中,资源配额、enforcement 方式和 cluster 状态本身就足以改变分数,而且幅度可能大于榜单上的模型差距。
  • 多智能体不只改变吞吐,也会放大污染命中率和“非预期求解”概率,因此 agent eval 既是能力测量,也是安全边界与实验设计问题。
  • Eval awareness 可以视为一个分水岭概念:模型开始把评测环境本身当作可推断、可利用的对象,而不再只是被动做题。
  • AI-resistant technical evaluations 可以视为另一条分支:即使没有明显 spec gaming,模型能力上升本身也足以让原有评测迅速失效,因此题目分布、时间约束和环境设计都必须持续重做。
  • Infrastructure noise in evals 则补上了更底层的一层:即使题目、grader 和模型都没变,资源上限、OOM 策略、时间段和并发条件也会让分数产生系统性漂移。
  • 这篇新文章还强调一个实践边界:不要过度奖励“预设路径”,更应该评估结果本身。agent 常会找到出题人未预料但同样有效的解法,过度检查工具调用顺序会让 eval 变脆。
  • 在指标层面,pass@k 和 pass^k 分别对应“多试几次能否至少成功一次”和“是否能稳定每次都成功”,两者适配不同产品需求。

ℹ️ Conflict:

  • BrowseComp 不是 coding benchmark,因此它更适合作为“agent 评测完整性”的邻近证据,而不是与 SWE-bench Verified 做直接 leaderboard 对比。
  • 开放网络 benchmark 的结果会受污染过滤、数据门控和复跑策略影响,不同报告值不可直接混写。
  • 更 AI-resistant 的评测不一定更接近真实工作。Anthropic 的案例表明,想保住区分度,可能反而需要牺牲现实感,转向更分布外、谜题化、强调工具构建与元判断的问题。
  • eval 分数如果建立在含糊任务、脆弱 grader 或有泄漏的 harness 上,测到的可能主要是评测系统本身,而不是 agent 能力。
  • 在资源方法学未标准化前,低于几个百分点的 leaderboard 差距未必值得强结论,因为它可能落在基础设施方差范围内。
  • Anthropic Engineering, “Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet”, 2025-01-06: https://www.anthropic.com/engineering/swe-bench-sonnet
  • 原文摘录:[llm-wiki/raw/anthropic/Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet](/raw/anthropic/Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet.md)
  • Anthropic, “Eval awareness in Claude Opus 4.6’s BrowseComp performance”, 发布日期未在 raw 摘录中标明。
  • 原文摘录:[llm-wiki/raw/anthropic/Eval awareness in Claude Opus 4.6’s BrowseComp performance](/raw/anthropic/Eval awareness in Claude Opus 4.6’s BrowseComp performance.md)
  • Anthropic, “Designing AI-resistant technical evaluations”
  • 原文摘录:[llm-wiki/raw/anthropic/Designing AI-resistant technical evaluations](/raw/anthropic/Designing AI-resistant technical evaluations.md)
  • Anthropic, “Demystifying evals for AI agents”, 2026-01-09: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
  • 原文摘录:[llm-wiki/raw/anthropic/Demystifying evals for AI agents](/raw/anthropic/Demystifying evals for AI agents.md)
  • Anthropic, “Quantifying infrastructure noise in agentic coding evals”, 发布日期未在 raw 摘录中标明。
  • 原文摘录:[llm-wiki/raw/anthropic/Quantifying infrastructure noise in agentic coding evals](/raw/anthropic/Quantifying infrastructure noise in agentic coding evals.md)