层次化合成表格数据生成:一种混合的自上而下和自下而上框架
机器学习
2026-05-28 v1
摘要
现有的合成表格数据生成方法要么基于纯生成模型,要么基于大语言模型,两者都在数据异构性、逻辑一致性、稀有事件覆盖以及低数据情景下的鲁棒性方面受到制约。本文提出一种层次化混合自上而下和自下而上 (H-TDBU) 框架,将语义结构与随机纹理解耦。在自上而下路径中,构建结构驱动的逻辑约束和跨模态对齐规则;在自下而上路径中,使用轻量级表格生成器从真实数据中学习局部统计模式。两种路径通过统一的合成引擎集成,并配以迭代反馈环。我们在弱多模态金融基准(组合表格和情感文本数据)上进行评估。实验结果表明,我们的H-TDBU方法在神经网络基线方法之上显著提升了train-synthetic-test-real性能,同时保持语义一致性。我们的结果表明,层次化规则导向的合成提供了一种有效机制,用于在合成数据生成中实现可控性、语义连贯性和统计保真性之间的结合。
引用
@article{arxiv.2605.28198,
title = {Hierarchical Synthetic Tabular Data Generation: A Hybrid Top-Down and Bottom-Up Framework},
author = {Junfeng Nie and Alvin Jin and Xiaohui Chen},
journal= {arXiv preprint arXiv:2605.28198},
year = {2026}
}
备注
Accepted as a poster at FMSD @ ICML 2026. 9 pages, 6 figures