MM-PoisonRAG:用于扰乱多模态 RAG 的局部与全局投毒攻击
机器学习
2026-05-28 v4 人工智能
密码学与安全
计算机视觉与模式识别
摘要
检索增强生成 (RAG) 已成为多模态大语言模型 (MLLM) 中的常见做法,以增强事实依从性并减少幻觉。然而,其依赖检索将 MLLMs 暴露于知识投毒攻击——攻击者将恶意多模态内容刻意注入外部知识库,以引导模型生成错误甚至有害的响应。我们提出 MM-PoisonRAG 框架,系统性地研究多模态 RAG 在知识投毒下的脆弱性。具体而言,我们设计了两种新型攻击策略:局部投毒攻击 (LPA),将针对性的、查询特定的多模态误导信息植入以操控输出导向攻击者控制的响应;全局投毒攻击 (GPA),使用单一的、非针对性的对抗性注入来广泛破坏推理并在所有查询上导致生成质量崩溃。在多样化任务、多模态 RAG 组件和不同攻击者访问权限下进行大量实验,揭示了严重的脆弱性:LPA 在受限访问下仍可实现最高 56% 的攻击成功率,并能有效迁移到四个不同的检索器而无需重新优化攻击者。GPA 只需一个被投毒内容即可使模型生成 accuracy 降至 0%。此外,LPA 和 GPA 均能突破现有防御,凸显了多模态 RAG 的脆弱性,并将 MM-PoisonRAG 确立为未来研究以保护 RAG 框架免受多模态知识投毒的基础。
引用
@article{arxiv.2502.17832,
title = {MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks},
author = {Hyeonjeong Ha and Qiusi Zhan and Jeonghwan Kim and Dimitrios Bralios and Saikrishna Sanniboina and Nanyun Peng and Kai-Wei Chang and Daniel Kang and Heng Ji},
journal= {arXiv preprint arXiv:2502.17832},
year = {2026}
}
备注
Code is available at https://github.com/HyeonjeongHa/MM-PoisonRAG