跳转到内容

Designing AI-resistant technical evaluations

这是一篇 Anthropic 发布的招聘与评测设计文章,主题是:随着 Claude 级别模型快速变强,原本能区分候选人能力层级的 take-home test 会很快被模型击穿,导致评估失去信号。作者以 Anthropic performance engineering 团队三次改版 take-home 的过程,讨论了什么样的技术测评在 AI 辅助环境下仍然能保有区分度。

  • 文章给出的起点很现实:一个曾经有效的性能工程 take-home,在 2025 年已经被 Claude Opus 4 和 Claude Opus 4.5 逐步打穿,先是超过多数候选人,再是追平最强候选人在限时条件下的表现。
  • 第一版 take-home 之所以有效,是因为它同时具备真实工作感、较长时间跨度、丰富的优化深度和高信号分布;但这些优点也让它逐渐变成高能力模型可通过长时间探索拿下的问题。
  • 作者没有选择简单地禁用 AI,而是把问题改写为“如何设计一个在 AI 存在时仍然能看出人的判断力、创造力和工具使用策略的评测”。
  • 第一次改版的方法是把 Claude 已经能稳定解决的前半段去掉,把更难的部分变成新的起点,并缩短时限。这一招只延缓了几个月。
  • 第二次尝试转向一个更难、更真实的 TPU/寄存器转置优化问题,但失败了,因为这类问题在跨平台工程史上有太多先验经验,模型能从训练语料中调动更广的“技巧库”。
  • 最终起作用的版本反而更“不真实”:作者借鉴 Zachtronics 风格谜题,设计了一个分布外、受限指令集、缺少可视化和调试工具的 puzzle 式 take-home,以迫使候选人通过构建工具、做元判断和解决陌生问题来体现能力。
  • 文章隐含的关键结论是:AI-resistant evaluation 不再主要依赖“更难”或“更像真实工作”,而更依赖“更分布外”“更要求元判断”“更不容易被已有经验库直接检索命中”。
  • 文末给出的开放挑战还提供了一组有参考价值的时点分数:2164 cycles1790 cycles1579 cycles1548 cycles1487 cycles1363 cycles,用来展示不同模型和不同 test-time compute 配置下的能力上移速度。

ℹ️ Conflict:

  • 这篇文章讲的是 Anthropic performance engineering 招聘场景,不应直接外推到所有技术招聘、所有工种或所有评测体系。
  • “更 AI-resistant” 与 “更真实地代表工作” 在文中是存在张力的;最终有效的方案恰恰牺牲了一部分现实感,换取了分布外性和区分度。
  • Anthropic, “Designing AI-resistant technical evaluations”, 原文摘录:[llm-wiki/raw/anthropic/Designing AI-resistant technical evaluations](/raw/anthropic/Designing AI-resistant technical evaluations.md)