跳转到内容

Agentic engineering

Agentic engineering 是关于“如何把模型当作主要执行者来组织软件开发”的主题页。它关注的不是单个 benchmark 或单个模型分数,而是工作流、上下文工程、工具闭环、项目结构、任务拆分、持久意图约束和人与 agent 的职责边界。

  • 这个主题的核心不是“让模型替代工程师”,而是把工程师的重心从手写实现转移到架构、约束、验收、手感判断和任务编排。
  • 如果只想抓住一线实践里的最小 checklist,可以先看 Agent 开发;它把这个主题压缩成更直接的工程注意事项清单。
  • 在《Shipping at Inference-Speed》中,一个代表性结论是:很多软件项目的瓶颈已从编码转移为推理等待时间和高质量决策,因此工作流设计比单次 prompt 技巧更重要。
  • Just Talk To It - the no-bs Way of Agentic Engineering》则把这个观点推得更极端:当模型已经足够稳时,很多 plan mode、subagents、MCP 和 worktree 式编排开始更像补丁而不是默认必要层,真正重要的是直接对话、持续校正和对 blast radius 的直觉。
  • Highlights from my conversation about agentic engineering on Lenny’s Podcast》则从另一位一线实践者角度补了一个外部验证:随着 2025-11 这一轮模型跃迁到来,很多场景里实现本身继续贬值,而测试、比较原型、判断可交付性和可信度变得更贵。
  • My fireside chat about agentic engineering at the Pragmatic Summit》则把这种判断进一步落到具体工作法上:先教 agent 怎么跑测试、要求 red/green TDD、再加一层手动验收和沙箱边界,而不是只靠“模型够强”。
  • Your job is to deliver code you have proven to work》则把这条线压得更明确:在 agent 时代,工程师的职责不是提交大补丁,而是提交已经被自己证明有效、并附带验证证据的改动。
  • CLI-first 是一个高复用模式:先做能被 agent 调用和验证的命令行闭环,再生长到 UI、扩展、自动化或跨设备场景。
  • 我们如何使用 Codex 在 28 天内构建 Android 版 Sora》则给出了一个来自 OpenAI 内部产品团队的密集交付案例:4 名工程师把 Codex 当作可并行协作的新任高级工程师,用 AGENTS.md、代表性实现和先规划后编码的流程,在 28 天内推进 Android 版 Sora 上线;与此同时,文章也明确承认瓶颈会从编码转向审查、反馈和变更整合。
  • THE 2028 GLOBAL INTELLIGENCE CRISIS》提供了这个主题的宏观风险镜像:同样的 agentic coding 能力如果被企业用于复制 SaaS、压价续约和削减白领岗位,微观生产率红利可能外溢成 AI 宏观经济风险Intelligence displacement spiral
  • 该主题通常偏好简化 harness:少一些额外抽象层,更多直接对话、文档约束、项目内说明和可执行工具。
  • Building effective agents》补上了这条路线最基础的架构判断:先分清 Workflows vs agents,再决定到底该用预定义编排,还是让模型在环境反馈中动态控制流程。
  • Code execution with MCP - Building more efficient agents》补充了另一条工程路线:当工具规模很大时,关键不只是“给 agent 接上工具”,而是把工具包装成模型可按需探索的代码接口,并把过滤、控制流和状态管理下沉到执行环境。
  • Building a C compiler with a team of parallel Claudes》则展示了另一条极端路线:把多个 agent 放进共享仓库、独立容器和长时循环中,让它们通过任务锁、merge 流程和测试 harness 近乎自主地推进一个大型软件项目。
  • How we built our multi-agent research system》则把多智能体路线带到生产研究场景:lead agent 负责规划和综合,subagent 负责并行搜索和上下文压缩,citation agent 负责最终可追溯性。
  • Harness design for long-running application development》补充了一个更细的观点:随着模型代际变化,好的 harness 不只是“堆更多组件”,而是持续检验哪些 planner、sprint、evaluator、context reset 仍然 load-bearing,哪些已经该删掉。
  • Writing effective tools for agents — with agents》则把注意力放到最底层:工具接口本身也是可优化对象。对 agent 来说,命名、namespacing、response format、error message 和 token 开销,都会像 prompt 一样影响行为。
  • Introducing advanced tool use on the Claude Developer Platform》则把这些工程经验收敛成平台级能力:动态工具发现、Programmatic tool calling 和工具使用示例,分别针对工具库规模、执行开销和参数精度这三类常见瓶颈。
  • Claude Code auto mode- a safer way to skip permissions》补充了另一个现实问题:当 agent 开始高频执行真实命令时,系统瓶颈不再只是“能力够不够”,还包括“谁来批准它的动作,以及这个审批流程会不会被摩擦拖垮”。
  • Beyond permission prompts- making Claude Code more secure and autonomous》则把这个问题再往下沉一层:与其反复审批,不如先用 Sandboxing for agents 把文件系统和网络能力边界收紧,再在边界内释放更多自治。
  • Scaling Managed Agents-Decoupling the brain from the hands》则继续把系统边界上提:与其把某一代 harness 和执行环境焊死,不如把 session / harness / sandbox 做成稳定接口,让长时 agent runtime 本身可以演化。
  • Best Practices for Claude Code》则把这些经验拉回用户工作流层:验证优先、探索与实现分离、CLAUDE.md / hooks / skills 分层,以及把 Context hygiene for agents 当成首要工程纪律。
  • The Spec Layer》则补上一条很关键但和“多测、多跑”不同的约束思路:agent 的常见失败模式不只是不会实现,而是会在自由度过大的情况下交付“局部正确但偏离意图”的结果,因此需要用低成本、可修改的 Spec-driven development 在人类意图和机器执行之间建立更窄接口。
  • Effective harnesses for long-running agents》则补了一个非常工程化的中间层:当任务必然跨越多个 context window 时,关键不是盲目延长会话,而是设计 Multi-context window workflows,让每个新 session 都能靠 artifact 顺利接班。
  • The “think” tool- Enabling Claude to stop and think in complex tool use situations》则补了另一条很轻量的路线:有时不需要更重的 runtime,只需要在复杂工具链中加入一个显式的 Reasoning tools for agents 步骤,就能显著提升一致性。
  • Effective context engineering for AI agents》则把前面这些分散经验提炼成一个总框架:真正的瓶颈常常不是 prompt 本身,而是 Context engineering,也就是如何把 system prompt、工具、检索、记忆、压缩和 subagent 结果组织成最小高信号上下文。
  • Introducing Contextual Retrieval》则把其中的 retrieval 一支讲得非常具体:如果知识库必须被切块索引,工程重点不只是“能不能搜到”,而是如何在预处理阶段把 chunk 丢掉的语境补回去。
  • Just Talk To It - the no-bs Way of Agentic Engineering》则代表了另一条鲜明分支:不是继续加更多 harness 和 abstraction,而是尽量把额外层拿掉,让强模型直接在自然语言对话和少量项目约束中完成大部分工作。
  • Highlights from my conversation about agentic engineering on Lenny’s Podcast》还补了一个很容易被忽略的后果:代码越便宜,“看起来像完成品”的假象越容易制造,因此工程师评估第三方项目和自己新项目的门槛反而会上升。
  • My fireside chat about agentic engineering at the Pragmatic Summit》则补了另一个常被忽略的实践层事实:如果项目有清晰模板、测试风格和现成模式,agent 往往会异常稳定地延续这些模式,所以“先把代码库整理好”本身就是 agent 工作流的一部分。
  • Your job is to deliver code you have proven to work》则把 reviewer 与作者的职责边界重新说清楚了:code review 可以补充发现问题,但不应替作者完成“这东西到底能不能工作”的第一性验证。
  • 从这个角度看,Spec-driven developmentprove it works 解决的是不同层面的问题:前者缩小行动前的搜索空间,后者证明行动后的结果成立,两者叠加才更接近可靠交付。
  • 高质量的 agentic engineering 仍然高度依赖人类做难判断:选依赖、定边界、定系统设计、识别技术债、判断何时重构与何时继续迭代。
  • 它与 Agent scaffold 相邻,但焦点更宽:scaffold 偏向单个 agent 运行壳层,agentic engineering 偏向整体开发方法论与组织方式。
  • 从这个角度看,Model Context Protocol (MCP) 不只是一个生态标准,也是在逼迫开发者重新设计目录结构、工具发现机制、安全沙箱和可复用 skill 层。
  • 从这个角度看,Agent teams 也不只是“多开几个模型窗口”,而是要求工程师真正设计并行度、任务切分、角色分工、oracle、回归测试和交接机制。
  • 从这个角度看,Multi-agent research systems 则说明,多智能体架构的核心收益有时不是劳动分工本身,而是把更大的 token 预算和更多独立 context window 真正投入到开放式搜索里。
  • 从这个角度看,Generator-evaluator loop 则把设计评审、QA 和 product critique 显式 agent 化,让“会做”和“会挑错”不再绑在同一个模型实例上。
  • 从这个角度看,Tool ergonomics for agents 则说明,很多工程优化并不发生在更高层 orchestrator,而是发生在单个工具定义被微调之后。
  • 从这个角度看,Programmatic tool calling 则把“让模型自己写代码编排工具”正式变成了主流工程选项,而不再只是 harness 爱好者的技巧。
  • 从这个角度看,Permission delegation for agents 则说明,自治系统的关键设计问题不只在任务分解和工具接入,也在于你如何把审批权在用户、规则、沙箱和分类器之间重新分配。
  • 从这个角度看,Sandboxing for agents 则说明,高自治不一定依赖更聪明的审批器,也可以依赖更硬的能力边界和代理层设计。
  • 从这个角度看,Meta-harness 则说明,未来 agent runtime 的关键设计问题不只是 prompt 和工具,而是哪些接口要保持稳定、哪些实现细节可以被替换。
  • 从这个角度看,Context engineering 则像这整条路线的上位词:很多过去被拆成 prompt、memory、retrieval、compaction 的技巧,本质上都在争夺模型有限的注意力预算。
  • 从这个角度看,blast radius 也是一个很实用的工程直觉:它不是正式框架,但能帮助人判断什么时候适合并行多个 agent,什么时候应该先打断、复核或缩小改动范围。
  • 从这个角度看,AGENTS.md + exemplar features + plan file 也是一个非常强的组合:它把团队偏好、局部模式和持久实施方向变成 agent 可重复读取的上下文外约束,减少“代码能跑但不符合系统意图”的情况。
  • 从这个角度看,tests are free 更像一种新的纪律而不是一句口号:既然让 agent 生成测试和跑回归的边际成本大幅下降,那么“不写测试”越来越像人为放弃最便宜的验证手段。
  • 从这个角度看,“prove it works” 也是一个非常硬的工程要求:验证不该是 review 之后补的步骤,而应是提交前就已完成并可展示的交付物。
  • 从这个角度看,人的 agency 仍然是核心变量:agent 可以执行,但不会天然拥有人的目标感、责任边界和长期动机,所以真正被放大的往往是人的主动性与判断,而不是某种“系统自己知道该做什么”。
  • 从这个角度看,Contextual Retrieval 则说明,很多检索问题并不是“embedding 模型太弱”,而是 chunk 在索引时已经失去太多语境。
  • 从这个角度看,Context hygiene for agents 则说明,很多看似“用户习惯”的小技巧,其实本质上是在做上下文工程和注意力预算管理。
  • 从这个角度看,Multi-context window workflows 则说明,跨窗连续性往往要靠 feature list、progress notes、init script 和 commit history 这类外部 artifact,而不是只靠上下文压缩。
  • 从这个角度看,Reasoning tools for agents 则说明,某些 agent 提升并不来自更多工具或更大上下文,而是来自在正确时机插入一个“先停下来想一想”的结构。

ℹ️ Conflict:

  • 该主题容易被误读为“以后不需要工程 discipline”。恰恰相反,模型越强,越要求人清楚地做约束、验收和系统级判断。
  • 单人开发者、终端优先环境与团队工程流程对这一主题的最佳实践并不相同;如 commit to main、少回滚、少分支等做法只在特定协作前提下可行。
  • 把工具转成代码接口和执行环境往往能省 token、提吞吐,但它也会引入新的安全与运维面;因此“更 agentic”不自动等于“系统更简单”。
  • 多 agent 长时自主开发虽然能把能力边界推高,但如果没有高质量 verifier 和人工验收,系统也更容易产生“测试都过了所以项目完成了”的虚假安全感。
  • 研究型多智能体系统虽然能显著提升开放式搜索能力,但代价往往是 token 成本成倍上涨,因此它天然偏向高价值、高并行度任务。
  • harness 复杂度会随模型能力边界移动而重新分布,因此“先做最简单版本,再逐项验证哪些结构确实必要”仍然是更稳的工程原则。
  • spec-driven development 的收益同样会随任务类型和模型代际变化而变化:跨上下文、大改动和高风险任务更需要持久意图约束,但小修、小步试探和探索式设计未必值得提前写重 spec。
  • 把多个 Codex 会话当作分布式工程团队来管理很有威力,但也会让人类快速变成审核/协调瓶颈,因此“更多 agent”并不自动等于“更快交付”。
  • agentic coding 的微观收益和宏观后果可能相互冲突:对单个团队是降本增效,对 SaaS、白领就业和消费循环则可能成为压力源;这类推演仍需和实际采用速度及政策适配一起看。
  • 为 agent 设计更高层、更 ergonomic 的工具通常能提效,但也会把更多业务假设固化进工具层,因此需要 eval 持续验证是否真的优于更通用的底层接口。
  • 高级 tool use 特性虽然能显著提效,但也会把系统推向更强的平台耦合、更高的调试复杂度和更细的权限/安全设计要求。
  • classifier 代审批虽然能显著降低摩擦,但它不是“免费自治”:对高风险动作,错误地理解用户授权边界依然是核心失效模式。
  • 沙箱边界虽然比纯分类器更硬,但如果目录、域名或代理规则配得过宽,系统同样会在“低摩擦”名义下重新暴露高风险能力。
  • meta-harness 虽然能减少某一代 harness 过时带来的重构成本,但也会显著增加运行时、恢复层和接口层的基础设施复杂度。
  • 过度强调 context hygiene 也会有副作用:如果每个任务都频繁清空、压缩和拆分,会破坏复杂问题的连续推理与局部积累。
  • 多 context workflow 虽然更稳,但也更保守;一轮只推进一个 feature 的策略能提高清洁度,却会牺牲吞吐与并行度。
  • reasoning tool 虽然实现简单,但也不是普适增益;在简单、非顺序或约束较弱的任务里,它通常只会增加 token 开销。
  • workflow 和 agent 在现实里往往不是二选一,而是一条连续谱;如果不区分哪些部分必须写死、哪些部分可以放权,系统很容易同时失去可预测性和灵活性。
  • Peter Steinberger, “Shipping at Inference-Speed”, 2025-12-28.
  • 原文摘录:[llm-wiki/raw/peter blog/Shipping at Inference-Speed](/raw/peter blog/Shipping at Inference-Speed.md)
  • Peter Steinberger, “Just Talk To It - the no-bs Way of Agentic Engineering”, 2025-10-14.
  • 原文摘录:[llm-wiki/raw/peter blog/Just Talk To It - the no-bs Way of Agentic Engineering](/raw/peter blog/Just Talk To It - the no-bs Way of Agentic Engineering.md)
  • Simon Willison, “Highlights from my conversation about agentic engineering on Lenny’s Podcast”, 2026-04-02.
  • 原文摘录:[llm-wiki/raw/01_AI/Highlights from my conversation about agentic engineering on Lenny’s Podcast](/raw/01_AI/Highlights from my conversation about agentic engineering on Lenny’s Podcast.md)
  • Simon Willison, “My fireside chat about agentic engineering at the Pragmatic Summit”.
  • 原文摘录:[llm-wiki/raw/01_AI/My fireside chat about agentic engineering at the Pragmatic Summit](/raw/01_AI/My fireside chat about agentic engineering at the Pragmatic Summit.md)
  • Simon Willison, “Your job is to deliver code you have proven to work”, 2025-12-18.
  • 原文摘录:[llm-wiki/raw/01_AI/Your job is to deliver code you have proven to work](/raw/01_AI/Your job is to deliver code you have proven to work.md)
  • OpenAI, “我们如何使用 Codex 在 28 天内构建 Android 版 Sora”, 2025-12-12: https://openai.com/zh-Hans-CN/index/shipping-sora-for-android-with-codex/
  • 原文摘录:[llm-wiki/raw/openai/我们如何使用 Codex 在 28 天内构建 Android 版 Sora](/raw/openai/我们如何使用 Codex 在 28 天内构建 Android 版 Sora.md)
  • CitriniResearch, “THE 2028 GLOBAL INTELLIGENCE CRISIS”, 2026-02-23: https://www.citriniresearch.com/p/2028gic?utm_source=chatgpt.com
  • 原文摘录:[llm-wiki/raw/01_AI/THE 2028 GLOBAL INTELLIGENCE CRISIS](/raw/01_AI/THE 2028 GLOBAL INTELLIGENCE CRISIS.md)
  • Anthropic, “Building effective agents”, 2024-12-19.
  • 原文摘录:[llm-wiki/raw/anthropic/Building effective agents](/raw/anthropic/Building effective agents.md)
  • Anthropic, “Code execution with MCP - Building more efficient agents”, 2025-11-04: https://www.anthropic.com/engineering/code-execution-with-mcp
  • 原文摘录:[llm-wiki/raw/anthropic/Code execution with MCP - Building more efficient agents](/raw/anthropic/Code execution with MCP - Building more efficient agents.md)
  • Anthropic, “Building a C compiler with a team of parallel Claudes”
  • 原文摘录:[llm-wiki/raw/anthropic/Building a C compiler with a team of parallel Claudes](/raw/anthropic/Building a C compiler with a team of parallel Claudes.md)
  • Anthropic, “How we built our multi-agent research system”, 2025-06-13.
  • 原文摘录:[llm-wiki/raw/anthropic/How we built our multi-agent research system](/raw/anthropic/How we built our multi-agent research system.md)
  • Anthropic, “Harness design for long-running application development”
  • 原文摘录:[llm-wiki/raw/anthropic/Harness design for long-running application development](/raw/anthropic/Harness design for long-running application development.md)
  • Anthropic, “Writing effective tools for agents — with agents”, 2025-09-11: https://www.anthropic.com/engineering/writing-effective-tools-for-agents-with-agents
  • 原文摘录:[llm-wiki/raw/anthropic/Writing effective tools for agents — with agents](/raw/anthropic/Writing effective tools for agents — with agents.md)
  • Anthropic, “Introducing advanced tool use on the Claude Developer Platform”, 2025-11-24: https://www.anthropic.com/engineering/introducing-advanced-tool-use-on-the-claude-developer-platform
  • 原文摘录:[llm-wiki/raw/anthropic/Introducing advanced tool use on the Claude Developer Platform](/raw/anthropic/Introducing advanced tool use on the Claude Developer Platform.md)
  • Anthropic, “Claude Code auto mode- a safer way to skip permissions”
  • 原文摘录:[llm-wiki/raw/anthropic/Claude Code auto mode- a safer way to skip permissions](/raw/anthropic/Claude Code auto mode- a safer way to skip permissions.md)
  • Anthropic, “Beyond permission prompts- making Claude Code more secure and autonomous”, 2025-10-20.
  • 原文摘录:[llm-wiki/raw/anthropic/Beyond permission prompts- making Claude Code more secure and autonomous](/raw/anthropic/Beyond permission prompts- making Claude Code more secure and autonomous.md)
  • Anthropic, “Scaling Managed Agents-Decoupling the brain from the hands”.
  • 原文摘录:[llm-wiki/raw/anthropic/Scaling Managed Agents-Decoupling the brain from the hands](/raw/anthropic/Scaling Managed Agents-Decoupling the brain from the hands.md)
  • Anthropic, “Best Practices for Claude Code”.
  • 原文摘录:[llm-wiki/raw/anthropic/Best Practices for Claude Code](/raw/anthropic/Best Practices for Claude Code.md)
  • Matt Rickard, “The Spec Layer”, 2026-03-31.
  • 原文摘录:[llm-wiki/raw/02_AI编程/The Spec Layer](/raw/02_AI编程/The Spec Layer.md)
  • Anthropic, “Effective harnesses for long-running agents”, 2025-11-26.
  • 原文摘录:[llm-wiki/raw/anthropic/Effective harnesses for long-running agents](/raw/anthropic/Effective harnesses for long-running agents.md)
  • Anthropic, “The “think” tool- Enabling Claude to stop and think in complex tool use situations”, 2025-03-20.
  • 原文摘录:[llm-wiki/raw/anthropic/The “think” tool- Enabling Claude to stop and think in complex tool use situations](/raw/anthropic/The “think” tool- Enabling Claude to stop and think in complex tool use situations.md)
  • Anthropic, “Effective context engineering for AI agents”, 2025-09-29.
  • 原文摘录:[llm-wiki/raw/anthropic/Effective context engineering for AI agents](/raw/anthropic/Effective context engineering for AI agents.md)
  • Anthropic, “Introducing Contextual Retrieval”, 2024-09-19.
  • 原文摘录:[llm-wiki/raw/anthropic/Introducing Contextual Retrieval](/raw/anthropic/Introducing Contextual Retrieval.md)