中文

基于 Lipschitz 正则化变分自编码器的差分隐私合成数据生成

机器学习 2023-07-14 v2

摘要

合成数据被誉为隐私保护数据分析的灵丹妙药。如果一条记录不是真实的,它又怎么会侵犯个人的隐私呢?此外,基于深度学习的生成模型被成功用于从数据中逼近复杂的高维分布,并从该学习到的分布中绘制出逼真的样本。但人们常常忽视的是,生成模型容易记住许多个体训练记录的细节,并且经常生成与底层敏感训练数据过于相似的合成数据,从而违反严格的隐私法规,例如在医疗保健中遇到的那些。差分隐私是保证敏感个人数据保护的最先进框架,它允许公开发布聚合统计甚至机器学习模型而不损害隐私。然而,训练机制通常在训练过程中添加过多噪声,从而严重损害这些私有模型的效用。更糟糕的是,紧张的隐私预算不允许进行许多训练轮次,因此模型质量在实践中无法得到适当控制。在本文中,我们探索了一种用于私有生成数据的替代方法,该方法直接利用生成模型(例如变分自编码器)中固有的随机性。主要思想是适当地约束深度模型的连续模,而不是在其上添加另一种噪声机制。对于这种方法,我们推导了数学上严格的隐私保证,并通过实际实验说明了其有效性。

关键词

引用

@article{arxiv.2304.11336,
  title  = {Differentially Private Synthetic Data Generation via Lipschitz-Regularised Variational Autoencoders},
  author = {Benedikt Groß and Gerhard Wunder},
  journal= {arXiv preprint arXiv:2304.11336},
  year   = {2023}
}