Ctrl-Z:通过重抽样控制 AI 智能体
机器学习
2025-04-15 v1
摘要
控制评估用于衡量监控和安全协议是否防止恶意 AI 模型引发伤害。我们的工作是在智能体环境中执行首次控制评估。我们构建了 BashBench,这是一个包含 257 个具有挑战性的多步骤系统管理任务的数据集,并评估了各种安全措施是否能够防止恶意构建的 AI 智能体在该环境中进行隐蔽性地下载和执行恶意代码。这种多步骤设置引入了新的攻击与防御动态,我们研究这些动态以设计新的控制协议,从而在不阻碍非恶意智能体执行有用工作的前提下,防止安全失效。我们提出了一种称为重抽样协议的控制协议类,这些协议通过动态对特定动作进行额外抽样来实现控制。我们发现,这些协议通过选择性阻止 AI 智能体执行可疑代码并通过生成恶意行为的额外示例来定罪智能体,显著优于现有技术。我们测量了攻击预防与实用性之间的权衡;我们最佳的协议将重抽样与对先前步骤的分析相结合,将攻击成功率从 58% 降低至 7%,同时仅以 5% 的成本影响非恶意智能体的性能。
引用
@article{arxiv.2504.10374,
title = {Ctrl-Z: Controlling AI Agents via Resampling},
author = {Aryan Bhatt and Cody Rushing and Adam Kaufman and Tyler Tracy and Vasil Georgiev and David Matolcsi and Akbir Khan and Buck Shlegeris},
journal= {arXiv preprint arXiv:2504.10374},
year = {2025}
}
备注
bashcontrol.com