中文

AI 控制中的重试 vs 重抽

人工智能 2026-05-27 v2

摘要

AI 编码脚手架如 Claude Code 和 Codex 使用重试机制: 对被标记为高风险的动作进行阻塞, 并继续执行轨迹。我们从 AI 控制角度研究重试机制, 将模型视为可能具有对抗性。我们发现, 尽管重试降低了诚实的疑虑得分, 但不可信模型可利用监控依据构造更狡猾的攻击, 抵消了安全收益。我们还研究了重抽: 从相同的上下文中抽取多个样本, 这不会泄露可被利用的信息。我们将之前工作中捆绑的设计选择解耦。在 BashArena 中, 以 Claude Opus 4.6 为不可信模型, MiMo-V2-Flash 为可信监控, 每步抽取 5 个样本并基于最大疑虑得分进行审计, 在 0.3% 审计预算下, 将安全性从 61% 提升至 71%, 且不会影响实用性。选择性地仅对在首次抽取时看起来可疑的步骤进行重抽, 可在抽取样本数量仅为原来的 10% 时恢复 6.2 个百分点的收益。我们结果中的两个发现与此前关于重抽的工作相矛盾: 第一个是, 基于重抽后疑虑得分最大值进行审计优于使用最小值, 这与 Ctrl-Z 的发现相反。第二个发现是, 执行最不疑虑的样本 (即此前延迟-重抽协议的核心机制) 在我们的设置下仅带来小幅安全收益 (+3.9 pp, 置信区间包含零)。

关键词

引用

@article{arxiv.2605.26047,
  title  = {Retrying vs Resampling in AI Control},
  author = {James Lucassen and Adam Kaufman},
  journal= {arXiv preprint arXiv:2605.26047},
  year   = {2026}
}