面向表格数据生成的深度学习方法综述:效用、对齐、保真度、隐私、多样性与更多维度
机器学习
2026-03-17 v2
摘要
生成式建模已成为合成表格数据的标准方法。然而,不同的应用场景要求合成数据满足不同的要求才能在实践中发挥作用。在本综述中,我们从五类要求的视角回顾了表格数据的深度生成式建模方法:合成数据的效用、合成数据与领域特定知识的对齐、合成数据分布相较于真实数据分布的统计保真度、隐私保护能力以及采样多样性。我们沿着两个粒度层级对这些方法进行分组: 基于它们所解决的要求; 根据它们所使用的基础模型。此外,我们总结了每种要求的适用评估方法、各要求之间的关系以及每种模型类型的具体特征。最后,我们讨论了该领域的未来方向,以及改进当前评估方法的机会。总体而言,本综述可被视为表格数据生成的用户指南:帮助读者在可用的模型和评估方法中进行导航,以找到最适合其需求的方法。
引用
@article{arxiv.2503.05954,
title = {A Survey on Deep Learning Approaches for Tabular Data Generation: Utility, Alignment, Fidelity, Privacy, Diversity, and Beyond},
author = {Mihaela Cătălina Stoian and Eleonora Giunchiglia and Thomas Lukasiewicz},
journal= {arXiv preprint arXiv:2503.05954},
year = {2026}
}
备注
Accepted to Transactions on Machine Learning Research (02/2026)