在差分隐私下生成表格数据集
机器学习
2023-08-30 v1 人工智能
密码学与安全
数据库
摘要
机器学习(ML)正加速各领域的进展,但其依赖可获取且高质量的训练数据。部分最重要的数据集以电子表格与关系数据库形式存在于生物医学与金融领域,而此类表格数据往往具有敏感性。合成数据生成有望释放敏感数据,但生成模型倾向于记忆并复现训练数据,有损隐私目标。为此,研究者将差分隐私(DP)的数学框架融入深度神经网络训练过程,但这在生成数据质量与隐私间形成权衡。生成对抗网络(GAN)是DP下合成表格数据的主流范式,却受不稳定的对抗训练与模式崩溃困扰,而隐私约束与棘手的表格数据模态更令其雪上加霜。本工作优化生成模型的质量-隐私权衡,在相同隐私保证下产出更高质量的表格数据集。我们实现利用注意力机制学习可逆表格表示的新型端到端模型,并引入TableDiffusion——首个用于表格数据合成的差分隐私扩散模型。实验表明,TableDiffusion生成更高保真度的合成数据集,规避模式崩溃问题,并在隐私化表格数据合成上取得SOTA性能。通过让TableDiffusion预测所加噪声,我们使其绕开了重构混合类型表格数据的难题。总体而言,得益于对每个数据批次的增强复用与更平滑的迭代训练过程,扩散范式被证明远比对抗范式更具数据与隐私效率。
引用
@article{arxiv.2308.14784,
title = {Generating tabular datasets under differential privacy},
author = {Gianluca Truda},
journal= {arXiv preprint arXiv:2308.14784},
year = {2023}
}