Permission delegation for agents
Permission delegation for agents 指不再由人类对 agent 的每一次敏感操作逐条审批,而是把一部分“是否允许执行”的判断委托给预定义规则、沙箱边界或模型分类器去完成。在当前 wiki 语境里,这个概念来自 Anthropic 对 Claude Code auto mode 的设计。
- 这个概念要解决的核心问题是 approval fatigue:当用户会批准绝大多数权限请求时,形式上的人工确认并不一定真的形成高质量安全边界。
- 权限委托的目标通常不是彻底移除边界,而是把“高频、低风险”的批准自动化,让人只处理真正高风险、不可逆、跨边界的动作。
- Anthropic 的
auto mode代表了一种 classifier-based delegation 路线:通过 prompt-injection probe 和 transcript classifier,把输入污染和输出动作分别过滤。 - 与此相对,《Beyond permission prompts- making Claude Code more secure and autonomous》展示了另一条 delegation 路线:通过 Sandboxing for agents 预先限定文件系统和网络能力,不再主要依赖“这一步意图安不安全”的判断。
- 这说明权限委托至少有三种常见落点:静态规则/allowlist、classifier-based delegation,以及 capability-based sandboxing。
- 其中 sandboxing 的特点是,把一部分安全性从“是否正确识别风险动作”转移为“就算识别错了,agent 也很难越过硬边界”。
- 从工程角度看,这个概念与 Agent scaffold 紧密相关,因为“哪些动作默认放行、哪些升级审批、哪些交给分类器判断”本身就是 scaffold 的关键部分;它也与 Agentic engineering 相关,因为它决定了自治、摩擦和安全之间的实际取舍。
ℹ️ Conflict:
- 权限委托不等于更安全,只是把风险从“用户每次都判断”转移成“你是否信任这套规则/分类器/沙箱配置”。
- classifier-based delegation 尤其有边界:它可能正确识别危险动作,却错误判断该动作是否真的被用户授权,因此在高风险场景里往往仍需要人工兜底。
- sandboxing 虽然更接近硬边界,但也不是“装上就安全”:目录范围、网络白名单和代理策略配置不当时,风险同样会重新暴露。
- Claude Code auto mode- a safer way to skip permissions
- Beyond permission prompts- making Claude Code more secure and autonomous
- Sandboxing for agents
- Anthropic
- Agent scaffold
- Agentic engineering
- Anthropic, “Claude Code auto mode- a safer way to skip permissions”, 原文摘录:[llm-wiki/raw/anthropic/Claude Code auto mode- a safer way to skip permissions](/raw/anthropic/Claude Code auto mode- a safer way to skip permissions.md)
- Anthropic, “Beyond permission prompts- making Claude Code more secure and autonomous”, 2025-10-20.
- 原文摘录:[llm-wiki/raw/anthropic/Beyond permission prompts- making Claude Code more secure and autonomous](/raw/anthropic/Beyond permission prompts- making Claude Code more secure and autonomous.md)