中文

RAGPart 与 RAGMask:检索阶段对抗检索增强生成中语料投毒的防御

信息检索 2026-01-01 v1

摘要

检索增强生成 (RAG) 已成为增强大型语言模型 (LLM) 外部知识的有前景范例,旨在减少幻觉现象并弥补信息陈旧问题。然而,近期研究揭示了 RAG 流程中存在关键漏洞:语料投毒攻击,诱使对手将恶意文档注入检索语料库以操控模型输出。为此,本文提出两种互补的检索阶段防御措施:RAGPart 与 RAGMask。我们的防御措施直接作用于检索器上,具备计算效率轻便且无需修改生成模型。RAGPart 利用稠密检索器内在的训练动力学,通过文档分区来缓解受投毒点的影响。相比之下,RAGMask 则基于显著相似度变化识别可疑标记。我们在两个基准测试上进行评估,涵盖四种投毒策略和四种最先进的检索器,结果显示我们的防御措施在保持良好效用的同时,显著降低了攻击成功率。我们进一步引入一种可解释的攻击以检验我们的防御措施。我们的发现凸显了检索阶段防御的潜力与局限,为稳健的 RAG 部署提供了实用见解。

关键词

引用

@article{arxiv.2512.24268,
  title  = {RAGPart & RAGMask: Retrieval-Stage Defenses Against Corpus Poisoning in Retrieval-Augmented Generation},
  author = {Pankayaraj Pathmanathan and Michael-Andrei Panaitescu-Liess and Cho-Yu Jason Chiang and Furong Huang},
  journal= {arXiv preprint arXiv:2512.24268},
  year   = {2026}
}

备注

Published at AAAI 2026 Workshop on New Frontiers in Information Retrieval [Oral]