针对大型语言模型间接提示注入攻击的基准测试与防御
计算与语言
2025-01-28 v4 人工智能
摘要
大型语言模型与外部内容的整合催生了如 Microsoft Copilot 等应用,但也引入了间接提示注入攻击的漏洞。在此类攻击中,嵌入在外部内容中的恶意指令可以操纵 LLM 的输出,导致其偏离用户预期。为了解决这一关键但尚未充分探索的问题,我们引入了首个针对间接提示注入攻击的基准测试,名为 BIPIA,以评估此类漏洞的风险。使用 BIPIA,我们评估了现有的 LLM,发现它们普遍存在漏洞。我们的分析识别了导致攻击成功的两个关键因素:LLM 无法区分信息性上下文与可执行指令,以及它们缺乏避免执行外部内容中指令的意识。基于这些发现,我们提出了两种新颖的防御机制——边界感知和显式提醒——以在黑盒和白盒设置中应对这些漏洞。大量实验表明,我们的黑盒防御提供了实质性的缓解,而我们的白盒防御将攻击成功率降低至接近零的水平,且所有这些均保持了 LLM 的输出质量。我们希望这项工作能激发对保障 LLM 应用安全的进一步研究,并促进其安全可靠的使用。
引用
@article{arxiv.2312.14197,
title = {Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models},
author = {Jingwei Yi and Yueqi Xie and Bin Zhu and Emre Kiciman and Guangzhong Sun and Xing Xie and Fangzhao Wu},
journal= {arXiv preprint arXiv:2312.14197},
year = {2025}
}
备注
Accepted by KDD 2025