ProGRank:一种用于防御密集检索 RAG 受语料库投毒的探针-梯度重排序方法
人工智能
2026-03-31 v2
摘要
检索增强生成(RAG)通过在生成时引用检索到的证据来提高大型语言模型应用的可靠性,但也引入了新的攻击面:语料库投毒。在此情境下,攻击者插入或编辑段落,使其被检索到的目标查询的 Top-K 结果排序,从而影响下游生成。现有的语料库投毒防御常依赖内容过滤、辅助模型或生成器侧推理,这些方法可能使部署更加困难。我们提出了 ProGRank,一种后置的、无需训练的检索器侧防御方法,用于密集检索 RAG。ProGRank 通过对每个查询-段落对在轻微随机扰动下的情景进行压力测试,从小型固定参数子集中提取探针梯度。从这些信号中,它派生出两种不稳定性信号:表征一致性和离散风险,并将其与得分门结合在重新排序步骤中。ProGRank 保留原始段落内容,无需重新训练,同时支持当部署检索器不可用时使用的代理基变体。广泛的实验在三个数据集、三个密集检索器 Backbone、代表性语料库投毒攻击以及检索阶段和端到端设置下进行,表明 ProGRank 提供更强的防御性能和有利的鲁棒性-效用权衡。它在自适应规避攻击下也保持竞争力。
引用
@article{arxiv.2603.22934,
title = {ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning},
author = {Xiangyu Yin and Yi Qi and Chih-Hong Cheng},
journal= {arXiv preprint arXiv:2603.22934},
year = {2026}
}