中文

PromptArmor:一种简单而有效的提示注入防御方法

密码学与安全 2025-07-22 v1 人工智能

摘要

尽管潜力巨大,但近期研究表明LLM代理对提示注入攻击十分脆弱,攻击者会将恶意提示注入到代理的输入中,导致其执行攻击者指定的任务而非用户提供的原意任务。本文提出PromptArmor,这是一种简单且有效的提示注入防御方法。具体而言,PromptArmor会要求一个现成的LLM在代理处理输入之前检测并移除其中的潜在注入提示。我们的实验结果表明,PromptArmor能够准确识别并移除注入提示。例如,使用GPT-4o、GPT-4.1或o4-mini时,PromptArmor在AgentDojo基准测试中,的假阳性率和假阴性率均低于1%。此外,在使用PromptArmor移除注入提示后,攻击成功率降至1%以下。我们还展示了PromptArmor对适应性攻击的有效性,并探讨了不同的LLM提示策略。我们建议PromptArmor作为评估新型提示注入防御方法的标准基准。

关键词

引用

@article{arxiv.2507.15219,
  title  = {PromptArmor: Simple yet Effective Prompt Injection Defenses},
  author = {Tianneng Shi and Kaijie Zhu and Zhun Wang and Yuqi Jia and Will Cai and Weida Liang and Haonan Wang and Hend Alzahrani and Joshua Lu and Kenji Kawaguchi and Basel Alomair and Xuandong Zhao and William Yang Wang and Neil Gong and Wenbo Guo and Dawn Song},
  journal= {arXiv preprint arXiv:2507.15219},
  year   = {2025}
}