Inference infrastructure regressions
Inference infrastructure regressions 指模型在部署、路由、编译、采样或硬件平台实现层面出现问题时,虽然模型权重本身未变,但用户实际体验到的输出质量仍然下降。在当前 wiki 语境里,这个概念来自 Anthropic 对 2025 年 8 月至 9 月三起基础设施质量事故的复盘。
- 这类问题的危险之处在于,它们往往不像“模型换代”那样显眼。用户只会感知到回答突然变差、偶尔乱码、代码错误率升高,表面上看像随机波动。
- 推理质量会受到很多非模型层因素影响,例如请求被路由到错误 server pool、采样实现存在精度问题、编译器在特定 batch 或硬件配置下误编译、或某个平台的 runtime 配置出错。
- 这意味着“同一个模型”并不天然保证“同样的实际质量”;跨硬件平台、跨云厂商、跨 serving path 的等价性需要被持续验证,而不能默认成立。
- 文章还说明,这类 regression 往往会逃过粗糙 eval,因为模型可能对个别错误有恢复能力;只有更敏感、持续、贴近真实生产的质量评估,才更可能尽早发现异常。
- 这个概念与 Anthropic 当前公开讨论的多种 agent/system 主题形成互补:前面很多文章讨论的是如何把模型能力推高,而这里提醒的是,推理基础设施本身也会在不改模型的前提下把质量拉低。
- 它也应和 Infrastructure noise in evals 区分开:前者偏生产 serving 回归,后者偏 benchmark 环境差异如何污染分数。
ℹ️ Conflict:
- 并非所有质量下降都来自推理基础设施;模型更新、策略改动、工具环境变化和评测方法漂移也都可能造成表象相似的退化。
- 仅凭用户零散反馈通常很难区分“正常主观波动”与“真实基础设施回归”,因此这类问题需要监控、评估和事故分析共同介入。
- Anthropic, “A postmortem of three recent issues”, 2025-09-17: https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues
- 原文摘录:[llm-wiki/raw/anthropic/A postmortem of three recent issues](/raw/anthropic/A postmortem of three recent issues.md)