中文

针对 R1-based 检索增强生成系统的链式思维投毒攻击

信息检索 2025-05-23 v1

摘要

检索增强生成 (RAG) 系统可有效缓解大型语言模型 (LLM) 的幻觉问题,但也存在固有的漏洞。在大规模实际部署前识别这些弱点至于构建更安全更稳健的 RAG 系统奠定基础。现有对抗攻击方法通常利用知识库投毒来探测 RAG 系统的漏洞,能够有效欺骗标准 RAG 模型。然而,随着深度推理能力在现代 LLM 中快速发展,仅注入错误知识的先前方法已不足以攻击具备深度推理能力的 RAG 系统。受深度思考能力启发,本文从 R1-based RAG 系统中提取推理过程模板,将这些模板用于包装错误知识以形成对抗性文档,并将其注入知识库以攻击 RAG 系统。其关键思想是,对抗性文档通过模拟与模型训练信号相匹配的链式思维模式,可能被模型误解为真实的历史推理过程,从而增加其被引用的可能性。在 MS MARCO passage ranking 数据集上进行实验,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2505.16367,
  title  = {Chain-of-Thought Poisoning Attacks against R1-based Retrieval-Augmented Generation Systems},
  author = {Hongru Song and Yu-an Liu and Ruqing Zhang and Jiafeng Guo and Yixing Fan},
  journal= {arXiv preprint arXiv:2505.16367},
  year   = {2025}
}

备注

7 pages,3 figures