跳转到内容

Quantifying infrastructure noise in agentic coding evals

这是一篇 Anthropic 的工程文章,主题是 agentic coding benchmark 中被低估的基础设施变量。它的核心结论是:在 Terminal-Bench、SWE-bench Verified 这类 agent eval 里,资源配置和执行环境并不是中性的容器,而会直接改变分数,甚至大到超过 leaderboard 上模型之间的名义差距。

  • 文章首先强调 agentic eval 和静态 benchmark 的差别:模型不只是输出答案,而是在真实环境里写代码、装依赖、跑测试、迭代,因此 runtime 本身已经成为测试的一部分。
  • Anthropic 在 Terminal-Bench 2.0 上发现,单是资源配置不同,就能让成功率在最严格和最宽松设置之间相差 6 个百分点,且 p < 0.01
  • 他们最初遇到的问题并不是“模型变差”,而是 Kubernetes 把 per-task resource spec 同时当作保底值和硬上限,导致容器一旦瞬时超额就被 OOM kill。
  • 文章区分了两种资源语义:guaranteed allocationhard kill threshold。如果两者被设成同一个值,就没有任何瞬时波动缓冲。
  • 在 Terminal-Bench 2.0 上,strict 1x 配置下 infra error rate 达到 5.8%;uncapped 时降到 0.5%
  • 1x3x,infra errors 明显下降,但成功率变化仍在噪声范围内;这意味着这一区间主要是在修复基础设施不稳定,而不是让题目变容易。
  • 3x 往上,成功率开始增长得比 infra errors 下降更快,说明额外资源已经开始改变 agent 能使用的求解策略,而不只是减少偶发崩溃。
  • 文中一个关键判断是:紧资源限制会偏好精简、节制的策略;宽资源限制则更奖励依赖大库、重子进程和高内存测试的策略。
  • 它还在 SWE-bench 上做了交叉实验:把 RAM 提升到 5x 后,分数也单调上升,只是幅度更小,约 1.54 个百分点。
  • 文章进一步指出,资源不是唯一隐变量。时间限制、并发度、egress bandwidth、cluster health,甚至一天中的时段都可能影响 pass rate。
  • 因此它建议 benchmark 不只公布单个资源值,而应明确 floorceiling 两个参数,并把 ceiling 校准到“既能消除基础设施噪声、又不明显放宽题目”的区间。
  • 最后的现实结论也很尖锐:在 resource methodology 未标准化前,agentic eval 上低于 3 个百分点的 leaderboard 差距都应保持怀疑。

ℹ️ Conflict:

  • 这篇文章并不是在说“评测没用”,而是在说 agent eval 测到的是模型与基础设施共同组成的系统,因此单个分数远没有看起来那么精确。
  • 更高资源配置有时是在消除伪噪声,有时又真的会放宽题目难度;两者的分界不是先验给定的,而需要经验校准。
  • 文章强烈依赖 Terminal-Bench 和 Anthropic 自己的运行方式,因此它给出的是一类普遍问题,而不是所有 benchmark 都共享同样幅度的数值结论。
  • Anthropic, “Quantifying infrastructure noise in agentic coding evals”, 发布日期未在 raw 摘录中标明。
  • 原文摘录:[llm-wiki/raw/anthropic/Quantifying infrastructure noise in agentic coding evals](/raw/anthropic/Quantifying infrastructure noise in agentic coding evals.md)