合成表格数据生成:现代技术的比较综述
机器学习
2025-07-17 v1
摘要
随着隐私法规日益严格以及对真实数据获取越来越受限,合成数据生成已成为尤其重要的解决方案,尤其是针对表格数据集,这类数据集是金融、医疗和社会科学等领域的核心。本综述提供了关于合成表格数据生成最新进展的全面而聚焦的综述,强调保持复杂特征关系、保持统计保真度并满足隐私要求的方法。本 work 的一个关键贡献是引入一种新颖的分类法,基于实际的生成目标,包括意在的下游应用、隐私保证以及数据效用,直接指导方法的设计与评估策略。因此,本综述优先考虑驱动合成数据创建的可操作目标,包括条件生成和风险敏感建模。此外,本综述提出了基准框架,以将技术创新与实际需求对齐。通过将理论基础与实际部署相结合,本 work 既是未来研究的路线图,也是实施隐私关键环境中合成表格数据的指南。
引用
@article{arxiv.2507.11590,
title = {Synthetic Tabular Data Generation: A Comparative Survey for Modern Techniques},
author = {Raju Challagundla and Mohsen Dorodchi and Pu Wang and Minwoo Lee},
journal= {arXiv preprint arXiv:2507.11590},
year = {2025}
}