中文

离散去噪扩散模型的内在隐私性质

机器学习 2024-06-04 v3

摘要

隐私问题催生了合成数据集的大量构建,扩散模型成为一种有前景的途径。尽管已有研究对这些模型做了实证评估,但在对其隐私保护能力给出数学刻画方面仍存在空白。为此,我们提出对用于离散数据集生成的离散扩散模型(DDMs)内在隐私保护的首个理论探索。聚焦于逐实例差分隐私(pDP),我们的框架阐明了给定训练数据集中各数据点的潜在隐私泄露,并揭示每点的隐私损失如何与数据集分布相关联。我们的界还表明,以 ss 大小的数据点训练会导致 DDM 从纯噪声过渡到合成干净数据阶段时,隐私泄露从 (ϵ,O(1s2ϵ))(\epsilon, O(\frac{1}{s^2\epsilon}))-pDP 激增至 (ϵ,O(1sϵ))(\epsilon, O(\frac{1}{s\epsilon}))-pDP,且扩散系数衰减越快,隐私保证越强。最后,我们在合成与真实世界数据集上实证验证了理论发现。

关键词

引用

@article{arxiv.2310.15524,
  title  = {On the Inherent Privacy Properties of Discrete Denoising Diffusion Models},
  author = {Rongzhe Wei and Eleonora Kreačić and Haoyu Wang and Haoteng Yin and Eli Chien and Vamsi K. Potluru and Pan Li},
  journal= {arXiv preprint arXiv:2310.15524},
  year   = {2024}
}

备注

58 pages