中文

DoomArena:用于测试面对演化安全威胁的 AI 代理框架

密码学与安全 2025-10-08 v3

摘要

我们提出了 DoomArena,一个针对 AI 代理的安全评估框架。DoomArena 的设计原则为:1)它是可插件的框架,可轻松集成到类似 BrowserGym(用于 web 代理)和 τ\tau-bench(用于工具调用代理)的现实代理框架中;2)它是可配置的,允许进行详细的威胁建模,允许配置代理框架特定组件可被攻击,并指定攻击者的目标;3)它是模块化的,解耦了攻击的开发与代理部署环境的细节,允许相同攻击在多个环境中应用。我们说明了框架的several优势,包括能够轻松适应新的威胁模型和环境、能够轻松组合以前发布的多种攻击以实现全面且细粒度的安全测试,以及能够分析各种漏洞与性能之间的权衡。我们将 DoomArena 应用于最先进(SOTA)web 和工具调用代理,发现若干惊人结果:1)SOTA 代理对不同威胁模型(恶意用户 vs 恶意环境)存在不同程度的脆弱性,且不存在在所有威胁模型中占主导地位的代理;2)当对代理应用多个攻击时,它们往往以建设性方式组合;3)基于警戒模型的防御似乎失效,而基于强大 SOTA LLM 的防御效果更好。DoomArena 可在 https://github.com/ServiceNow/DoomArena 获得。

关键词

引用

@article{arxiv.2504.14064,
  title  = {DoomArena: A framework for Testing AI Agents Against Evolving Security Threats},
  author = {Leo Boisvert and Mihir Bansal and Chandra Kiran Reddy Evuru and Gabriel Huang and Abhay Puri and Avinandan Bose and Maryam Fazel and Quentin Cappart and Jason Stanley and Alexandre Lacoste and Alexandre Drouin and Krishnamurthy Dvijotham},
  journal= {arXiv preprint arXiv:2504.14064},
  year   = {2025}
}