Shipping at Inference-Speed
这是一篇 Peter Steinberger 于 2025-12-28 发布的 workflow 文章。文章的核心判断是:对大量日常软件开发而言,瓶颈已经不再是“人亲手写代码”,而是模型推理时间与人类在架构、依赖和产品感觉上的判断速度。作者把这种状态概括为“以 inference speed 发货”。
- 作者认为 2025 年下半年 agentic coding 的质变在于:很多任务已经默认可以 one-shot 或接近 one-shot 完成,交付速度越来越受限于模型等待时间而不是编码速度。
- 他强烈偏好
codex/GPT-5.x 系列作为主力 coding agent,认为其特点是先长时间读代码、再谨慎下手,因此虽然单次更慢,但整体返工更少。 - 文章反复强调一个实践原则:先把任何新想法做成 CLI。因为 CLI 最容易让 agent 调用、验证、闭环,再在此基础上长出 UI、扩展或自动化能力。
- 作者不太认同复杂 harness、plan mode、RAG、MCP 和“子智能体编排”在日常开发中的中心地位,认为很多这类机制是在弥补旧模型/弱模型的不足,而不是最佳默认范式。
- 他的实际工作流是高度迭代式的:同时跑多个项目、频繁排队任务、很少回滚、常直接提交到
main、在同一上下文中持续推进而不是频繁开新上下文。 - 文中把真正仍然困难的部分明确留给人:技术栈选择、依赖质量判断、系统设计、数据流拆分、产品体验与“手感”的判断。
- 作者把代码库、文档、目录结构乃至
AGENTS.md都当成面向 agent 设计的环境,而不只是面向人类维护。 - GPT-5.2 后,他认为外部“oracle”式增强需求显著下降,说明更强模型本身已经吃掉了不少原先要靠外围系统补的能力缺口。
ℹ️ Conflict:
- 这篇文章高度基于作者的个人场景:单人开发、终端优先、多个自有项目并行、较高模型订阅预算、对主分支直接演化的容忍度较高。团队协作环境下并不一定成立。
- 文中大量判断是强烈经验主义和工具偏好,例如对 Claude Code、plan mode、MCP、worktree 的评价,不应直接视为普适结论。
- Peter Steinberger, “Shipping at Inference-Speed”, 2025-12-28.
- 原文摘录:[llm-wiki/raw/peter blog/Shipping at Inference-Speed](/raw/peter blog/Shipping at Inference-Speed.md)