STaSy:基于分数的表格数据合成
机器学习
2023-05-30 v4 人工智能
数据库
摘要
表格数据合成是机器学习中一个长期的研究课题。过去几十年中提出了许多不同方法,从统计方法到深度生成方法。然而,由于真实世界表格数据的复杂性,该任务并非总获成功。本文中,我们提出一种名为基于分数的表格数据合成(Score-based Tabular data Synthesis, STaSy)的新模型及其基于分数生成建模范式的训练策略。尽管分数生成模型已解决生成模型中的诸多问题,表格数据合成仍有改进空间。我们提出的训练策略包含自步学习技术与微调策略,通过稳定去噪分数匹配训练进一步提升采样质量与多样性。此外,我们还就生成任务三难问题——采样质量、多样性与时间——进行了严谨的实验研究。在 15 个基准表格数据集与 7 个基线的实验中,我们的方法在任务依赖评估与多样性方面优于现有方法。代码见 https://github.com/JayoungKim408/STaSy。
引用
@article{arxiv.2210.04018,
title = {STaSy: Score-based Tabular data Synthesis},
author = {Jayoung Kim and Chaejeong Lee and Noseong Park},
journal= {arXiv preprint arXiv:2210.04018},
year = {2023}
}
备注
27 pages, Accepted by ICLR 2023 for spotlight presentation, Official code: https://github.com/JayoungKim408/STaSy