CTAB-GAN:高效的表格数据合成
机器学习
2021-06-02 v2
摘要
尽管数据共享对知识发展至关重要,但隐私担忧与严格监管(如欧洲通用数据保护条例(GDPR))不幸限制了其充分发挥效用。合成表格数据作为一种替代方案出现,能在满足监管与隐私约束的同时实现数据共享。最先进的表格数据合成器从生成对抗网络(GAN)汲取方法,并处理工业中两种主要数据类型,即连续型与分类型。本文中,我们开发了 CTAB-GAN,一种新颖的条件表格 GAN 架构,可有效建模多样数据类型,包括连续与分类变量的混合。此外,我们处理数据不平衡与长尾问题,即某些变量在大数值上频率差异剧烈。为实现这些目标,我们首先将信息损失与分类损失引入条件 GAN。其次,我们设计了一种新颖的条件向量,高效编码混合数据类型与数据变量的偏斜分布。我们针对生成合成表格的最先进 GAN,从数据相似性与分析效用方面广泛评估 CTAB-GAN。在五个数据集上的结果表明,CTAB-GAN 的合成数据对所有三类变量都极似真实数据,并使五种机器学习算法的准确率最高提升 17%。
引用
@article{arxiv.2102.08369,
title = {CTAB-GAN: Effective Table Data Synthesizing},
author = {Zilong Zhao and Aditya Kunar and Hiek Van der Scheer and Robert Birke and Lydia Y. Chen},
journal= {arXiv preprint arXiv:2102.08369},
year = {2021}
}
备注
This paper consists of 11 pages which contain 8 figures, 5 tables and an appendix with a user manual for our software application