跳转到内容

Permission delegation for agents

Permission delegation for agents 指不再由人类对 agent 的每一次敏感操作逐条审批,而是把一部分“是否允许执行”的判断委托给预定义规则、沙箱边界或模型分类器去完成。在当前 wiki 语境里,这个概念来自 Anthropic 对 Claude Code auto mode 的设计。

  • 这个概念要解决的核心问题是 approval fatigue:当用户会批准绝大多数权限请求时,形式上的人工确认并不一定真的形成高质量安全边界。
  • 权限委托的目标通常不是彻底移除边界,而是把“高频、低风险”的批准自动化,让人只处理真正高风险、不可逆、跨边界的动作。
  • Anthropic 的 auto mode 代表了一种 classifier-based delegation 路线:通过 prompt-injection probe 和 transcript classifier,把输入污染和输出动作分别过滤。
  • 与此相对,《Beyond permission prompts- making Claude Code more secure and autonomous》展示了另一条 delegation 路线:通过 Sandboxing for agents 预先限定文件系统和网络能力,不再主要依赖“这一步意图安不安全”的判断。
  • 这说明权限委托至少有三种常见落点:静态规则/allowlist、classifier-based delegation,以及 capability-based sandboxing。
  • 其中 sandboxing 的特点是,把一部分安全性从“是否正确识别风险动作”转移为“就算识别错了,agent 也很难越过硬边界”。
  • 从工程角度看,这个概念与 Agent scaffold 紧密相关,因为“哪些动作默认放行、哪些升级审批、哪些交给分类器判断”本身就是 scaffold 的关键部分;它也与 Agentic engineering 相关,因为它决定了自治、摩擦和安全之间的实际取舍。

ℹ️ Conflict:

  • 权限委托不等于更安全,只是把风险从“用户每次都判断”转移成“你是否信任这套规则/分类器/沙箱配置”。
  • classifier-based delegation 尤其有边界:它可能正确识别危险动作,却错误判断该动作是否真的被用户授权,因此在高风险场景里往往仍需要人工兜底。
  • sandboxing 虽然更接近硬边界,但也不是“装上就安全”:目录范围、网络白名单和代理策略配置不当时,风险同样会重新暴露。
  • Anthropic, “Claude Code auto mode- a safer way to skip permissions”, 原文摘录:[llm-wiki/raw/anthropic/Claude Code auto mode- a safer way to skip permissions](/raw/anthropic/Claude Code auto mode- a safer way to skip permissions.md)
  • Anthropic, “Beyond permission prompts- making Claude Code more secure and autonomous”, 2025-10-20.
  • 原文摘录:[llm-wiki/raw/anthropic/Beyond permission prompts- making Claude Code more secure and autonomous](/raw/anthropic/Beyond permission prompts- making Claude Code more secure and autonomous.md)