中文

DP-TLDM:差分隐私表格潜在扩散模型

机器学习 2025-07-23 v2 密码学与安全

摘要

生成模型产生的合成数据作为隐私保护的数据共享解决方案。合成数据集应类似于原始数据,同时不揭露可识别的私人信息。迄今为止,先前的研究重点仅限于有限类型的表格合成器和少数隐私攻击,尤其是生成对抗网络,忽略了成员推断攻击及其防御策略,即差分隐私。针对保持高质量数据与低隐私风险之间的困境,我们提出DPTLDM(Differentially Private Tabular Latent Diffusion Model),由用于编码表格数据的自动编码器网络和用于合成潜在表格的潜在扩散模型组成。遵循新兴的 f-DP 框架,我们应用 DP-SGD 训练自动编码器,结合批量剪裁,并使用分离值作为隐私度量,以更好地捕捉差分隐私算法带来的隐私收益。我们的实证评估表明,DPTLDM能够在保持相当水平隐私风险的同时,实现有意义的理论隐私保障,并显著提升合成数据的实用性。具体而言,与其他受 DP 保护的表格生成模型相比,DPTLDM 在数据类比性上提高了平均 35%,在下游任务实用性上提高了 15%,在数据可区分性上提高了 50%。

关键词

引用

@article{arxiv.2403.07842,
  title  = {DP-TLDM: Differentially Private Tabular Latent Diffusion Model},
  author = {Chaoyi Zhu and Jiayi Tang and Juan F. Pérez and Marten van Dijk and Lydia Y. Chen},
  journal= {arXiv preprint arXiv:2403.07842},
  year   = {2025}
}