通过隐形之眼:针对 RAG 中投毒攻击的注意力感知防御
密码学与安全
2026-05-25 v2 人工智能
摘要
检索增强生成(RAG)系统对注入已被投毒化的检索上下文的攻击极其脆弱,即使在低损坏率下亦然。我们指出现有攻击并非设计为隐形化,从而允许可靠的检测与缓解。我们形式化一种基于区分度的安全博弈,以量化此类攻击的隐形性。若少数投毒段落主导响应,则它们必须偏离良性段落更大程度地影响推理过程,从而本质上妥协了隐形性。这激励分析 LLM 的中间信号,如注意力权重,以近似估计不同段落对响应的影响。基于注意力权重,我们引入了归一化段落注意力得分(NPAS)和一种轻量级注意力方差过滤器(AV Filter),以标记异常段落。我们的方法提升了鲁棒性,相较于基线防御可提高约 20% 的准确率。我们还开发了尝试隐藏此类异常的自适应攻击,成功率可达 35%,凸显了在 RAG 系统中实现真正隐形投毒的挑战。
引用
@article{arxiv.2506.04390,
title = {Through the Stealth Lens: Attention-Aware Defenses Against Poisoning in RAG},
author = {Sarthak Choudhary and Nils Palumbo and Ashish Hooda and Krishnamurthy Dj Dvijotham and Somesh Jha},
journal= {arXiv preprint arXiv:2506.04390},
year = {2026}
}
备注
Accepted at ICML 2026