置换不变的表格数据合成
机器学习
2022-11-18 v1
摘要
表格数据合成是一种新兴方法,用于在通过大数据发现知识的同时规避严格的数据隐私法规。尽管最先进的基于 AI 的表格数据合成器,例如 table-GAN、CTGAN、TVAE 和 CTAB-GAN,在生成合成表格数据方面行之有效,但它们的训练对输入数据的列置换敏感。在本文中,我们首先进行广泛的实证研究以揭示这种置换不变性属性,并对现有合成器进行深入分析。我们表明,由于表格数据的编码和网络架构,改变输入列顺序会使真实数据与合成数据之间的统计差异恶化多达 38.67%。为充分释放大合成表格数据的潜力,我们提出两种解决方案:(i) AE-GAN,一种使用自编码器网络表示表格数据并使用 GAN 网络合成潜在表示的合成器;(ii) 一种特征排序算法,用于为基于 CNN 的合成器寻找合适的输入数据列顺序。我们在五个数据集上根据对列置换的敏感性、合成数据质量以及下游分析中的效用评估所提出的方案。我们的结果表明,我们在训练合成器时增强了置换不变性属性,并且与现有合成器相比,进一步将合成数据的质量和效用提高了多达 22%。
引用
@article{arxiv.2211.09286,
title = {Permutation-Invariant Tabular Data Synthesis},
author = {Yujin Zhu and Zilong Zhao and Robert Birke and Lydia Y. Chen},
journal= {arXiv preprint arXiv:2211.09286},
year = {2022}
}
备注
Paper is accepted in 2022 IEEE International Conference Big Data in Special Session Privacy and Security of Big Data (PSBD)