中文

RAG 中的偏见放大:投毒知识检索以引导 LLMs

机器学习 2025-06-16 v1 计算与语言 密码学与安全

摘要

在大型语言模型中,检索增强生成(RAG)系统通过整合外部知识可以显著提升大语言模型的性能。然而,RAG 也引入了新的安全风险。现有研究主要关注投毒攻击如何影响 RAG 系统中的模型输出质量,而忽视了其放大模型偏见的潜力。例如,当查询关于家庭暴力受害者的内容时,被攻破的 RAG 系统可能会优先检索将女性描绘为受害者的文档,导致模型即使在原始查询性别中立的情况下也生成延续性别刻板印象的输出。为了展示偏见的影响,本文提出了一种偏见检索与奖励攻击(BRRA)框架,系统地研究了通过 RAG 系统操控放大语言模型偏见的攻击路径。我们设计了一种基于多目标奖励函数的对抗文档生成方法,采用子空间投影技术操控检索结果,并构建了循环反馈机制以实现持续偏见放大。在多个主流大语言模型上的实验表明,BRRA 攻击可以显著增强模型在多个维度上的偏见。此外,我们探索了一种双阶段防御机制以有效缓解攻击影响。本研究揭示了 RAG 系统中的投毒攻击直接放大了模型输出偏见,并阐明了 RAG 系统安全性与模型公平性之间的关系。这一新颖的潜在攻击表明,我们需要关注 RAG 系统的公平性问题。

关键词

引用

@article{arxiv.2506.11415,
  title  = {Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs},
  author = {Linlin Wang and Tianqing Zhu and Laiqiao Qin and Longxiang Gao and Wanlei Zhou},
  journal= {arXiv preprint arXiv:2506.11415},
  year   = {2025}
}