面向知识密集型LLM的集成隐私防御:应对成员推理攻击
密码学与安全
2025-12-04 v1 人工智能
摘要
检索增强生成(RAG)和监督微调(SFT)已成为为大型语言模型(LLMs)配备外部知识以应对多样化知识密集型任务的主导范式。然而,尽管此类知识注入改善了性能,但也暴露了新的攻击面。成员推理攻击(MIAs),旨在判断给定数据样本是否包含在模型的训练集中,对敏感领域的隐私和信任构成严重威胁。为此,我们首先系统评估了基于RAG和SFT的LLMs对各种MIAs的脆弱性。然后,为应对隐私风险,我们进一步引入了一种新颖的、与模型无关的防御框架——集成隐私防御(EPD),该框架聚合并评估知识注入LLM、基础LLM和专用裁判模型的输出,以增强对MIAs的抵抗力。全面实验表明,平均而言,EPD将SFT的MIA成功率降低高达27.8%,将RAG的MIA成功率降低高达526.3%(相对于推理时基线),同时保持了回答质量。
引用
@article{arxiv.2512.03100,
title = {Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks},
author = {Haowei Fu and Bo Ni and Han Xu and Kunpeng Liu and Dan Lin and Tyler Derr},
journal= {arXiv preprint arXiv:2512.03100},
year = {2025}
}