中文

基于异构序列特征森林流匹配的表格数据生成

机器学习 2025-05-29 v1

摘要

隐私和监管约束使得数据生成成为推动机器学习进步的关键路径,无需依赖真实世界数据集。表格数据生成的主流方法之一是 Forest Flow (FF) 方法,它将流匹配(Flow Matching)与 XGBoost 结合。尽管该方法性能良好,但 FF 在将分类变量处理为 one-hot 连续特征时较慢且易出错,且对常微分方程(ODE)的初始条件极其敏感。为克服这些限制,我们开发了异构序列特征森林流匹配(Heterogeneous Sequential Feature Forest Flow, HS3F)。该方法逐特征(feature-by-feature)生成数据,通过利用先前生成特征的额外信息,减少了对噪声初始条件的依赖。此外,HS3F 使用来自 XGBoost 分类器的多项抽样(multinomial sampling)生成分类变量,而非流匹配,从而提升生成速度。我们还采用 4 阶 Runge-Kutta(Rg4)ODE 求器,以提升相较于 FF 中使用的欧拉(Euler)求器的性能。我们的实验使用 25 个数据集表明,HS3F 产生的高质量且更具多样性的合成数据优于 FF,尤其在分类变量方面。HS3F 还显示出对流 ODE 初始条件仿射变换的鲁棒性优于 FF。该研究不仅验证了 HS3F,也揭示了推动生成模型发展的前景新策略。

关键词

引用

@article{arxiv.2410.15516,
  title  = {Generating Tabular Data Using Heterogeneous Sequential Feature Forest Flow Matching},
  author = {Ange-Clément Akazan and Alexia Jolicoeur-Martineau and Ioannis Mitliagkas},
  journal= {arXiv preprint arXiv:2410.15516},
  year   = {2025}
}