中文

RAG 系统中隐私风险与缓解措施的系统综述

密码学与安全 2026-01-08 v1 计算与语言

摘要

大型语言模型 (LLM),尤其在其自然语言理解和生成能力方面的持久前景,推动了日益增加的兴趣,以识别和开发 LLM 用例。为补充 LLM 内在的“知识”,检索增强生成 (RAG) 技术变得广受欢迎。其核心在于将 LLM 与特定领域的知识库相耦合,从而通过上下文和最新信息来增强对用户提问的响应生成。RAG 的普及引发了数据隐私的担忧,特别是当利用可能包含敏感信息的数据库时潜在的风险。近期诸多工作探索了 RAG 系统中各种方面的隐私风险,从对抗攻击到提出的缓解措施。为实现对这些工作的调查和统一,我们提出了一个简单问题:RAG 中的隐私风险是什么,如何衡量和缓解?为回答此问题,我们对解决隐私问题的 RAG 文献进行了系统性文献综述,并将我们的发现系统化为一套全面的隐私风险、缓解技术和评估策略。我们补充这些发现,提供两个主要制品:RAG 隐私风险分类学和 RAG 隐私流程图。我们的工作不仅通过对风险和缓解措施进行第一次系统化,还通过揭示在缓解 RAG 系统中的隐私风险以及评估当前缓解措施成熟度的重要考虑因素。

关键词

引用

@article{arxiv.2601.03979,
  title  = {SoK: Privacy Risks and Mitigations in Retrieval-Augmented Generation Systems},
  author = {Andreea-Elena Bodea and Stephen Meisenbacher and Alexandra Klymenko and Florian Matthes},
  journal= {arXiv preprint arXiv:2601.03979},
  year   = {2026}
}

备注

17 pages, 3 figures, 5 tables. This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML 2026). The final version will be available on IEEE Xplore