注意力是所有必需的:用于对抗LLM中间接提示注入攻击的防御
密码学与安全
2025-12-12 v2
摘要
大型语言模型(LLM)已集成到许多应用程序(例如网页代理)中,以执行更复杂的任务。然而,LLM驱动的应用程序可能受到间接提示注入(IPI)攻击的威胁,这类攻击通过不可信的外部数据源注入指令。本文提出了一种名为Rennervate的防御框架,用于检测和防止IPI攻击。Rennervate利用注意力特征在细粒度token级别检测隐蔽注入,从而实现精确的消毒,中和IPI攻击同时保持LLM功能。具体而言,基于注意力池化机制的token级检测器,对注意力头和响应token进行IPI检测和消毒。此外,我们建立了一个细粒度IPI数据集FIPI,计划开源以支持进一步的研究。广泛的实验验证表明,Rennervate在15种商业和学术IPI防御方法中表现优异,在5个LLM和6个数据集上实现高精度。我们还展示了Rennervate对未见攻击具有可迁移性,对适应性对手具有鲁棒性。
关键词
引用
@article{arxiv.2512.08417,
title = {Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs},
author = {Yinan Zhong and Qianhao Miao and Yanjiao Chen and Jiangyi Deng and Yushi Cheng and Wenyuan Xu},
journal= {arXiv preprint arXiv:2512.08417},
year = {2025}
}
备注
Accepted by Network and Distributed System Security (NDSS) Symposium 2026