CTAB-GAN+:增强表格数据合成
机器学习
2022-04-04 v1
摘要
尽管数据共享对知识发展至关重要,但隐私担忧与严格监管(如欧洲通用数据保护条例(GDPR))限制了其充分发挥效用。合成表格数据作为替代方案出现,可在满足监管与隐私约束的同时实现数据共享。最先进的表格数据合成器从生成对抗网络(GAN)汲取方法。随着 GAN 改进,合成数据愈发近似真实数据,面临泄露隐私风险。差分隐私(DP)提供隐私损失的理论保证但会降低数据效用。取得最佳权衡仍属悬而未决的研究问题。我们提出 CTAB-GAN+ 这一新型条件表格 GAN。CTAB-GAN+ 相较最先进水平有如下改进:(i)向条件 GAN 添加下游损失,以在分类与回归领域获得更高效用合成数据;(ii)使用带梯度惩罚的 Wasserstein 损失以获得更好训练收敛;(iii)引入针对混合连续-类别变量及不平衡或偏斜数据变量的新型编码器;(iv)以 DP 随机梯度下降训练以施加严格隐私保证。我们针对最先进表格 GAN 广泛评估 CTAB-GAN+ 的数据相似度与分析效用。结果表明,在不同隐私预算下的多个数据集与学习任务中,CTAB-GAN+ 合成的数据在隐私保护前提下效用至少高出 48.16%。
引用
@article{arxiv.2204.00401,
title = {CTAB-GAN+: Enhancing Tabular Data Synthesis},
author = {Zilong Zhao and Aditya Kunar and Robert Birke and Lydia Y. Chen},
journal= {arXiv preprint arXiv:2204.00401},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2102.08369, arXiv:2108.10064