AgentVigil:针对大语言模型智能体间接提示注入的通用黑盒红队测试框架
密码学与安全
2025-06-17 v4 人工智能
摘要
大语言模型(LLMs)强大的规划和推理能力促进了基于智能体的系统的发展,这些系统能够利用外部工具并与日益复杂的环境进行交互。然而,这些强大的功能也引入了一个关键的安全风险:间接提示注入。这是一种复杂的攻击向量,通过操纵上下文信息而非直接的用户提示来破坏这些智能体的核心——大语言模型。在这项工作中,我们提出了一个通用的黑盒模糊测试框架 AgentVigil,旨在自动发现并利用跨不同大语言模型智能体的间接提示注入漏洞。我们的方法首先构建一个高质量的初始种子语料库,然后采用基于蒙特卡洛树搜索(MCTS)的种子选择算法迭代优化输入,从而最大化发现智能体弱点的可能性。我们在两个公开基准 AgentDojo 和 VWA-adv 上评估了 AgentVigil,它针对基于 o3-mini 和 GPT-4o 的智能体分别取得了 71% 和 70% 的成功率,几乎将基线攻击的性能提高了一倍。此外,AgentVigil 在未见过的任务和内部大语言模型上表现出强大的可迁移性,并在对抗防御措施方面取得了有希望的结果。除了基准评估之外,我们还在真实环境中应用了我们的攻击,成功误导智能体导航到任意 URL,包括恶意站点。
引用
@article{arxiv.2505.05849,
title = {AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents},
author = {Zhun Wang and Vincent Siu and Zhe Ye and Tianneng Shi and Yuzhou Nie and Xuandong Zhao and Chenguang Wang and Wenbo Guo and Dawn Song},
journal= {arXiv preprint arXiv:2505.05849},
year = {2025}
}