中文

CTAB-GAN:高效的表格数据合成

机器学习 2021-06-02 v2

摘要

尽管数据共享对知识发展至关重要,但隐私担忧与严格监管(如欧洲通用数据保护条例(GDPR))不幸限制了其充分发挥效用。合成表格数据作为一种替代方案出现,能在满足监管与隐私约束的同时实现数据共享。最先进的表格数据合成器从生成对抗网络(GAN)汲取方法,并处理工业中两种主要数据类型,即连续型与分类型。本文中,我们开发了 CTAB-GAN,一种新颖的条件表格 GAN 架构,可有效建模多样数据类型,包括连续与分类变量的混合。此外,我们处理数据不平衡与长尾问题,即某些变量在大数值上频率差异剧烈。为实现这些目标,我们首先将信息损失与分类损失引入条件 GAN。其次,我们设计了一种新颖的条件向量,高效编码混合数据类型与数据变量的偏斜分布。我们针对生成合成表格的最先进 GAN,从数据相似性与分析效用方面广泛评估 CTAB-GAN。在五个数据集上的结果表明,CTAB-GAN 的合成数据对所有三类变量都极似真实数据,并使五种机器学习算法的准确率最高提升 17%。

关键词

引用

@article{arxiv.2102.08369,
  title  = {CTAB-GAN: Effective Table Data Synthesizing},
  author = {Zilong Zhao and Aditya Kunar and Hiek Van der Scheer and Robert Birke and Lydia Y. Chen},
  journal= {arXiv preprint arXiv:2102.08369},
  year   = {2021}
}

备注

This paper consists of 11 pages which contain 8 figures, 5 tables and an appendix with a user manual for our software application