中文

MELON:针对 AI 智能体中间接提示注入攻击的可证明防御

密码学与安全 2025-06-12 v4 人工智能

摘要

最近的研究表明,LLM 智能体容易受到间接提示注入(Indirect Prompt Injection, IPI)攻击,其中嵌入在工具检索信息中的恶意任务可以重定向智能体执行未经授权的操作。现有的 IPI 防御存在显著局限性:要么需要必要的模型训练资源,要么缺乏对抗复杂攻击的有效性,要么损害正常功能。我们提出了 MELON(Masked re-Execution and TooL comparisON),一种新颖的 IPI 防御方法。我们的方法基于这样一个观察:在成功的攻击下,智能体的下一步行动会变得较少依赖于用户任务,而更多依赖于恶意任务。据此,我们设计了 MELON,通过使用一个经过掩码函数修改的掩码用户提示重新执行智能体的轨迹来检测攻击。如果原始执行和掩码执行中生成的动作相似,我们就识别为攻击。我们还包含了三个关键设计以减少潜在的假阳性和假阴性。在 IPI 基准测试 AgentDojo 上的广泛评估表明,MELON 在攻击防御和功能保持方面均优于 SOTA 防御方法。此外,我们表明将 MELON 与一种 SOTA 提示增强防御(称为 MELON-Aug)相结合,可以进一步提高其性能。我们还进行了详细的消融研究以验证我们的关键设计。代码可在 https://github.com/kaijiezhu11/MELON 获取。

关键词

引用

@article{arxiv.2502.05174,
  title  = {MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents},
  author = {Kaijie Zhu and Xianjun Yang and Jindong Wang and Wenbo Guo and William Yang Wang},
  journal= {arXiv preprint arXiv:2502.05174},
  year   = {2025}
}

备注

ICML 2025