中文

通过大语言模型重建差分隐私文本消除后的内容

密码学与安全 2025-09-19 v3 人工智能 机器学习

摘要

差分隐私(Differential Privacy,DP)是防止隐私泄露攻击的事实标准,包括许多最近发现的针对大语言模型(LLM)的攻击。然而,我们发现 LLM 能够从给定的 DP-消除/移除的隐私文本中重建这些更改。我们提出了两种基于对 LLM 可访问性的攻击方法(黑盒攻击和白盒攻击),并展示了 LLM 能否通过给定示例文本对作为指令(在黑盒攻击中)或微调数据(在白盒攻击中)来连接 DP-消除后的文本与对应的私有训练数据。为说明我们的发现,我们在现代 LLM(如 LLaMA-2、LLaMA-3、ChatGPT-3.5、ChatGPT-4、ChatGPT-4o、Claude-3、Claude-3.5、OPT、GPT-Neo、GPT-J、Gemma-2 和 Pythia)上进行了全面实验,使用常用数据集(如 WikiMIA、Pile-CC 和 Pile-Wiki)针对单词级和句子级 DP。实验结果显示出令人鼓舞的恢复率,例如针对 WikiMIA 数据集上单词级 DP 的黑盒攻击在 LLaMA-2(70B)上达到 72.18%,在 LLaMA-3(70B)上达到 82.39%,在 Gemma-2 上达到 75.35%,在 ChatGPT-4o 上达到 91.2%,在 Claude-3.5(Sonnet)上达到 94.01%。更紧急的是,这项研究表明,这些著名的 LLM 已然成为当前环境下现有 DP 文本消除方法的新的安全风险。

关键词

引用

@article{arxiv.2410.12443,
  title  = {Reconstruction of Differentially Private Text Sanitization via Large Language Models},
  author = {Shuchao Pang and Zhigang Lu and Haichen Wang and Peng Fu and Yongbin Zhou and Minhui Xue},
  journal= {arXiv preprint arXiv:2410.12443},
  year   = {2025}
}

备注

RAID-2025