中文

振动即泄漏:精调扩散模型会放大生成式隐私风险

机器学习 2024-04-23 v2 密码学与安全

摘要

尽管近期扩散模型在生成逼真图像方面取得了显著进展,但也潜伏着隐私风险:公开发布的模型或 API 可能生成训练图像,从而泄露与训练数据相关的隐私敏感信息。本文揭示了一种新风险,即 Shake-to-Leak (S2L),即通过使用加工数据精调预训练模型会放大现有的隐私风险。我们演示了 S2L 可能在扩散模型的各种标准精调策略中发生,包括概念注入方法 (DreamBooth 和 Textual Inversion) 和参数高效方法 (LoRA 和 Hypernetwork),以及它们的组合。在最坏情况下,S2L 可将扩散模型上最新的数据驱动成员推断攻击 (MIA) 的 AUC 提升 5.4%,平均每个目标领域可从几乎 0 个样本提取到 15.8 个私人样本。这一发现表明,扩散模型的隐私风险比此前认识的更为严重。代码已公开于 https://github.com/VITA-Group/Shake-to-Leak。

关键词

引用

@article{arxiv.2403.09450,
  title  = {Shake to Leak: Fine-tuning Diffusion Models Can Amplify the Generative Privacy Risk},
  author = {Zhangheng Li and Junyuan Hong and Bo Li and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2403.09450},
  year   = {2024}
}