中文

语义变色龙:RAG系统中语料库依赖的投毒攻击与防御

密码学与安全 2026-03-20 v1 人工智能 机器学习

摘要

检索增强生成(RAG)系统通过外部知识源扩展大型语言模型(LLM),但通过检索管道引入新的攻击面。特别是,攻击者可以投毒检索语料库,使恶意文档在推理时优先被检索,从而实现对模型输出的有针对性操控。我们研究了针对现代RAG管道的梯度引导语料库投毒攻击,并评估了需要无需修改底层LLM的检索层防御。我们实现了由睡眠文档和触发文档组成的双文档投毒攻击,使用Greedy Coordinate Gradient(GCG)进行优化。在Security Stack Exchange语料库(67,941个文档)上的大规模评估中进行了50次攻击,梯度引导投毒在纯向量检索下实现了38.0%的联检率。我们表明,一种简单的架构修改——结合BM25和向量相似性的混合检索——显著缓解了此类攻击。跨所有50次攻击,混合检索将梯度引导攻击成功率从38%降至0%,而无需修改模型或重新训练检索器。当攻击者针对稀疏和稠密检索信号联合优化有效载荷时,混合检索可被部分绕过,实现20-44%的成功率,但仍显著提高了攻击难度,相对于仅使用向量检索而言。跨五个LLM家族(GPT-5.3、GPT-4o、Claude Sonnet 4.6、Llama 4和GPT-4o-mini)的评估显示,攻击成功率范围在46.7%至93.3%之间。在FEVER维基百科数据集(25次攻击)上的跨语料库评估显示,所有检索配置下攻击成功率均为0%。

关键词

引用

@article{arxiv.2603.18034,
  title  = {Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems},
  author = {Scott Thornton},
  journal= {arXiv preprint arXiv:2603.18034},
  year   = {2026}
}

备注

10 pages, 5 figures