测量权限门限:Claude Code 自动模式的压力测试评估
软件工程
2026-04-29 v2 人工智能
密码学与安全
摘要
Claude Code 的自动模式是首个部署的 AI 编程代理权限系统,使用两阶段转录分类器来限制危险工具调用。Anthropic 报告在生产流量中误报率为 0.4%,漏报率为 17%。我们首次在故意模糊的授权场景上对该系统进行独立评估,即用户意图明确但目标范围、爆炸半径或风险级别未明确指定的任务。使用 AmPermBench,一个涵盖四个 DevOps 任务族和三个受控模糊轴共 128 个提示的基准,我们在个体动作层面针对 oracle 真实标签评估了 253 个状态变更动作。我们的发现刻画了自动模式在这种压力测试工作负载下的范围升级覆盖能力。端到端漏报率为 81.0%(95% 置信区间:73.8%-87.4%),远高于生产流量中报告的 17%,反映了一个根本不同的工作负载,而非矛盾。值得注意的是,36.8% 的所有状态变更动作通过第二层(项目内文件编辑)超出了分类器的范围,导致端到端漏报率升高。即使将范围限制在分类器实际评估的 160 个动作(第三层),漏报率仍为 70.3%,而误报率上升至 31.9%。第二层覆盖缺口在工件清理(92.9% 漏报率)方面最为明显,当预期 CLI 不可用时,代理自然会回退到编辑状态文件。这些结果揭示了一个值得关注的覆盖边界:自动模式假设危险动作经过 shell,但代理经常通过分类器不评估的文件编辑实现等效效果。
引用
@article{arxiv.2604.04978,
title = {Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode},
author = {Zimo Ji and Zongjie Li and Wenyuan Jiang and Yudong Gao and Shuai Wang},
journal= {arXiv preprint arXiv:2604.04978},
year = {2026}
}