针对提示注入攻击防御的批判性评估
密码学与安全
2025-05-27 v1 人工智能
摘要
大型语言模型(LLM)对提示注入攻击存在脆弱性,近期提出了多种防御方法,常声称能成功缓解这些攻击。然而,我们认为现有研究缺乏对防御措施进行原则性评估的方法。本文主张需从两个关键维度评估防御措施:(1)有效性,通过针对现有和适应性提示注入攻击(涉及多样化目标和注入提示)进行评估;(2)通用实用性,确保防御措施不损害LLM的基础能力。我们的批判性评估揭示,前期研究未遵循此类全面评估方法论。采用此原则方法评估后,我们表明现有防御措施的成功程度并不如此前报告的那样。本工作为评估未来防御措施及指导其开发提供了基础。我们的代码和数据已公开:https://github.com/PIEval123/PIEval。
引用
@article{arxiv.2505.18333,
title = {A Critical Evaluation of Defenses against Prompt Injection Attacks},
author = {Yuqi Jia and Zedian Shao and Yupei Liu and Jinyuan Jia and Dawn Song and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2505.18333},
year = {2025}
}