保护检索增强生成:攻击、防御与未来方向的分类
密码学与安全
2026-05-28 v2 人工智能
摘要
检索增强生成(RAG)通过外部知识扩展大型语言模型(LLM),但这种访问路径也引入了安全风险,现有工作常将其与固有的LLM缺陷混为一谈。我们将安全RAG定义为保护外部知识访问,并以SLOT分类法组织文献:沿四个维度:攻击发生地点(Surface, S),控制相同节点的防御层(Layer, L),遵循CIA属性破坏的目标(Objective, O),以及其 pursuit 的目标(Target, T),从单个已知查询(T1)到针对查询分布的目标主张操控(T2)。将攻击、防御、补救和评估映射到六阶段知识访问管道,我们暴露了两个结构性不匹配。最后,我们讨论了更现实的目标、无盲区且具有自适应评估防御、更强的保密性以及面向多模态和智能体RAG的评估等方向。
引用
@article{arxiv.2604.08304,
title = {Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions},
author = {Yuming Xu and Mingtao Zhang and Zhuohan Ge and Haoyang Li and Nicole Hu and Yongqi Zhang and Zhiyuan Wen and Jason Chen Zhang and Qing Li and Lei Chen},
journal= {arXiv preprint arXiv:2604.08304},
year = {2026}
}