合成表格数据生成综述
计算机视觉与模式识别
2026-01-06 v2 多媒体
摘要
表格数据是医疗、金融和教育等实际应用中最常见且重要的数据格式之一。然而,由于数据稀缺、隐私 concerns 以及类别不平衡,其在机器学习中的有效应用常受限。合成表格数据生成作为一种强大解决方案,利用生成模型学习数据分布并生成逼真且隐私保护的样本。尽管该领域受到日益关注,但大多数现有综述仅聚焦于特定方法(如GAN或隐私增强技术),缺乏整合扩散模型和大语言模型(LLM)等近期进展的统一、全面视角。本综述提供了结构化、深入的综述。具体包括三大模块:(1)背景部分涵盖整体生成流程,包括问题定义、合成表格数据生成方法、后处理及评估;(2)生成方法部分将现有方法划分为传统生成方法、扩散模型方法和LLM-based方法,并从架构、生成质量和适用性进行比较;(3)应用与挑战部分总结实际应用场景,突出常见数据集,讨论诸如异构性、数据保真度和隐私保护等开放挑战。本综述旨为研究者和实践者提供该领域的整体理解,并指出未来工作在合成表格数据生成中的关键方向。
引用
@article{arxiv.2504.16505,
title = {TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning},
author = {Meng Chu and Yukang Chen and Haokun Gui and Shaozuo Yu and Yi Wang and Jiaya Jia},
journal= {arXiv preprint arXiv:2504.16505},
year = {2026}
}
备注
AAAI 2026 Oral