检索混淆生成是防御大语言模型隐私违规攻击的有效方法
密码学与安全
2025-06-26 v1 人工智能
摘要
近期大语言模型(LLM)的快速发展对社会产生了深远影响,也引发了新的安全问题。特别是鉴于LLM的卓越推理能力,Staab 等人揭示的隐私违规攻击(PVA)引发了严重的个人隐私问题。现有防御方法主要依赖于对输入查询进行匿名化处理,这需要高昂的推理时间且无法获得令人满意的防御效果。此外,直接拒绝PVA查询似乎是有效的防御方法,但该防御方法一旦被暴露,会促进PVA的演化。本文提出了一种基于检索混淆生成(RCG)的新型防御范式,该范式可以高效且隐蔽地防御PVA。我们首先设计了一种改写提示词,以诱导LLM重写攻击查询的“用户评论”,以构建扰动后的数据库。随后,我们提出最不相关的检索策略,从扰动后的数据库中检索所需的用户数据。最后,用检索到的用户数据替换“数据评论”,形成防御后的查询,从而使模型对抗性地返回一些错误的个人属性,即攻击失败。对两个数据集和八个流行的LLM进行大量实验,以全面评估所提防御方法的可行性和优势。
引用
@article{arxiv.2506.19889,
title = {Retrieval-Confused Generation is a Good Defender for Privacy Violation Attack of Large Language Models},
author = {Wanli Peng and Xin Chen and Hang Fu and XinYu He and Xue Yiming and Juan Wen},
journal= {arXiv preprint arXiv:2506.19889},
year = {2025}
}