迈向安全的检索增强生成:威胁、防御与基准的综合综述
密码学与安全
2026-03-24 v1 人工智能
摘要
检索增强生成(Retrieval-Augmented Generation, RAG)通过引入外部知识库,显著缓解了大型语言模型中的幻觉和领域知识不足问题。然而,RAG 的多模块架构引入了复杂的系统级安全漏洞。本文以 RAG 工作流为指引,分析了潜在的漏洞机制,并系统性地对核心威胁向量进行了分类,如数据投毒、对抗攻击和成员推断攻击。基于此威胁评估,我们从输入和输出两个阶段的视角构建了 RAG 防御技术的分类体系。输入侧分析回顾了包括动态访问控制、同态加密检索和对抗性预过滤在内的数据保护机制。输出侧检验总结了先进的防泄漏技术,如联邦学习隔离、差分隐私扰动和轻量级数据脱敏。为了为未来的实验设计建立统一的基准,我们整合了权威的测试数据集、安全标准和评估框架。据我们所知,本文是首篇专门针对 RAG 系统安全性的端到端综述。与现有文献孤立地关注特定漏洞不同,我们系统性地描绘了整个流程,提供了对威胁模型、防御机制和评估基准的统一分析。通过深化对潜在风险的理解,本工作旨在促进高度鲁棒且可信的下一代 RAG 系统的开发。
引用
@article{arxiv.2603.21654,
title = {Towards Secure Retrieval-Augmented Generation: A Comprehensive Review of Threats, Defenses and Benchmarks},
author = {Yanming Mu and Hao Hu and Feiyang Li and Qiao Yuan and Jiang Wu and Zichuan Liu and Pengcheng Liu and Mei Wang and Hongwei Zhou and Yuling Liu},
journal= {arXiv preprint arXiv:2603.21654},
year = {2026}
}