中文

谁教会了谎言?检索增强生成中的被毒化知识责任归属

密码学与安全 2025-10-21 v2 信息检索 机器学习

摘要

检索增强生成(RAG)将外部知识集成到大型语言模型中以提升响应质量。然而,近期研究表明 RAG 系统对毒化攻击极其脆弱,恶意文本被插入知识库以影响模型输出。虽然已提出多种防御措施,但常被更具适应性或高级攻击所规避。本文提出 RAGOrigin,一个针对 RAG 中被毒化知识责任归属的黑盒框架,用于识别知识库中导致误导或不正确生成的文本。该方法构建针对每个误生成事件的聚焦归因范围,通过评估候选文本的检索排序、语义相关性及对生成响应的影响来为每个候选文本分配责任得分。系统随后使用无监督聚类方法隔离被毒化文本。我们在七个数据集和十五种毒化攻击(包括新开发的自适应毒化策略和多攻击者情景)上评估了 RAGOrigin。结果表明,我们的方法在识别被毒化内容方面优于现有基线,在动态和噪声环境下仍保持鲁棒性。这些结果表明 RAGOrigin 为追踪 RAG 系统中损坏知识的来源提供了实用且有效的解决方案。我们的代码已公开:https://github.com/zhangbl6618/RAG-Responsibility-Attribution

关键词

引用

@article{arxiv.2509.13772,
  title  = {Who Taught the Lie? Responsibility Attribution for Poisoned Knowledge in Retrieval-Augmented Generation},
  author = {Baolei Zhang and Haoran Xin and Yuxi Chen and Zhuqing Liu and Biao Yi and Tong Li and Lihai Nie and Zheli Liu and Minghong Fang},
  journal= {arXiv preprint arXiv:2509.13772},
  year   = {2025}
}

备注

To appear in the IEEE Symposium on Security and Privacy, 2026