AgentDojo:用于评估 LLM 代理的提示注入攻击与防御的动态环境
密码学与安全
2024-11-26 v3 机器学习
摘要
AI 代理旨在通过结合基于文本的推理与外部工具调用来解决复杂任务。不幸的是,AI 代理易受提示注入攻击,攻击者可利用外部工具返回的数据劫持代理执行恶意任务。为衡量 AI 代理的对抗鲁棒性,我们引入AgentDojo,一个针对执行不受信任数据工具调用的代理的评估框架。为捕捉攻击与防御的演进性质,AgentDojo并非静态测试套件,而是可设计和评估新型代理任务、防御措施及自适应攻击的可扩展环境。我们向环境中填充了97个真实任务(例如管理电子邮件客户端、浏览在线银行网站或预订旅行),以及629个安全测试案例,涵盖文献中各种攻击与防御范式。我们发现AgentDojo对攻击与防御都提出了挑战:最先进的 LLM 在许多任务中表现不佳(即使无攻击),且现有提示注入攻击会破坏部分安全属性但并非全部。我们希望AgentDojo能促进针对AI代理的新设计原则的研究,使其能可靠且稳健地解决常见任务。我们已在 https://github.com/ethz-spylab/agentdojo 上发布代码。
引用
@article{arxiv.2406.13352,
title = {AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents},
author = {Edoardo Debenedetti and Jie Zhang and Mislav Balunović and Luca Beurer-Kellner and Marc Fischer and Florian Tramèr},
journal= {arXiv preprint arXiv:2406.13352},
year = {2024}
}
备注
Updated version after fixing a bug in the Llama implementation and updating the travel suite