中文

关于检索增强生成系统的成员推断攻击

密码学与安全 2025-03-10 v3 人工智能 机器学习

摘要

检索增强生成 (RAG) 系统在自然语言处理领域展现出巨大潜力。然而,由于其依赖存储在检索数据库中的数据(可能包含专有或敏感信息),引入了新的隐私问题。具体而言,攻击者可以通过观察 RAG 系统的输出来推断某文本段落是否出现在检索数据库中,称为成员推断攻击 (MIA)。尽管存在这一威胁,但针对 RAG 系统的 MIA 研究尚未得到充分探索。本研究通过引入一种高效且易于使用的针对 RAG 系统进行 MIA 的方法来填补这一空白。我们使用两个基准数据集和多个生成模型演示了攻击的有效性,显示通过创建适当的提示词,即可在黑盒和灰盒设置下高效确定文档在检索数据库中的成员身份。此外,我们引入一种初始防御策略,基于向 RAG 模板中添加指令,该策略对某些数据集和模型显示出高效能。我们的发现凸显了在部署的 RAG 系统中实施安全对策的重要性,以及开发更先进防御措施以保护检索数据库隐私和安全的必要性。

关键词

引用

@article{arxiv.2405.20446,
  title  = {Is My Data in Your Retrieval Database? Membership Inference Attacks Against Retrieval Augmented Generation},
  author = {Maya Anderson and Guy Amit and Abigail Goldsteen},
  journal= {arXiv preprint arXiv:2405.20446},
  year   = {2025}
}

备注

12 pages, 4 figures