间接提示注入:防火墙够用了吗,还是需要更强的基准?
密码学与安全
2026-03-24 v2
摘要
AI代理对间接提示注入攻击十分脆弱,这类攻击将嵌入外部内容或工具输出中的恶意指令导致意外或有害行为。以众所周知的防火墙概念为灵感,我们展示了一个简单、模块化且对模型agnostic的防御措施,在所有四个公共基准(AgentDojo、Agent Security Bench、InjecAgent和tau-Bench)上都实现了完美的安全性和高效用,同时在与先前结果相比较下实现了state-of-the-art的安全-效用权衡。具体而言,我们采用两个防火墙:工具输入防火墙(Minimizer)和工具输出防火墙(Sanitizer)。不同于先前复杂的方法,本防御对代理做出了最小的假设,并且可即插即用地部署。这使得其高度可通用性同时保持强大的性能而不损害效用。我们的分析还揭示了这些现有基准的关键局限性,包括错误的成功指标、实现错误,最重要的是,弱攻击,阻碍了进步。为了解决这些问题,我们为AgentDojo和Agent Security Bench提出了针对性的修复,并提出了更健壮基准设计的最佳实践。此外,我们引入了一个三阶段攻击策略,将标准提示注入攻击、二阶攻击和自适应攻击级联,以评估超越现有攻击的鲁棒性。总体而言,我们的工作表明,现有的agentic安全基准可以通过简单的方法轻易被饱和,并凸显需要更强的基准以谨慎选择评估指标和强大的自适应攻击的必要性。
引用
@article{arxiv.2510.05244,
title = {Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks?},
author = {Rishika Bhagwatkar and Kevin Kasa and Abhay Puri and Gabriel Huang and Irina Rish and Graham W. Taylor and Krishnamurthy Dj Dvijotham and Alexandre Lacoste},
journal= {arXiv preprint arXiv:2510.05244},
year = {2026}
}