利用合成数据优化 AI 智能体攻击
人工智能
2025-11-05 v1
摘要
随着 AI 部署变得愈发复杂和高风险,能够评估其风险变得越来越重要。AI 控制是用于此目的的一个框架。然而,良好的控制评估需要引出强大的攻击策略。这在复杂的智能体环境中可能具有挑战性,因为计算约束使我们数据匮乏。在这项工作中,我们展示了如何在 SHADE-Arena(一个包含多种真实控制环境的数据集)中优化攻击策略。我们通过将攻击能力分解为五个组成技能——怀疑建模、攻击选择、计划合成、执行和隐蔽性——并单独优化每个组件来实现这一点。为了绕过有限数据的限制,我们开发了一个攻击动力学的概率模型,使用此模拟优化我们的攻击超参数,然后证明结果可以迁移到 SHADE-Arena。这导致了攻击强度的显著提升,使用我们的脚手架将安全分数从基线的 0.87 降低到 0.41。
引用
@article{arxiv.2511.02823,
title = {Optimizing AI Agent Attacks With Synthetic Data},
author = {Chloe Loughridge and Paul Colognese and Avery Griffin and Tyler Tracy and Jon Kutasov and Joe Benton},
journal= {arXiv preprint arXiv:2511.02823},
year = {2025}
}