中文

面向混合类型表格数据的连续扩散模型

机器学习 2026-03-27 v7 机器学习

摘要

基于分数的生成模型,通常被称为扩散模型,已被证明在生成文本和图像数据方面是成功的。然而,它们对混合类型表格数据的适应仍待深入探索。在本工作中,我们提出了 CDTD,一种面向混合类型表格数据的连续扩散模型。CDTD 基于分数匹配和分数插值的新颖组合,为连续和分类特征强制实施统一的连续噪声分布。我们通过依赖特定模型的损失校准和初始化方案,明确承认了同质化不同数据类型的必要性。为了进一步解决混合类型表格数据中的高异构性问题,我们引入了自适应的特定特征或特定类型噪声调度。这确保了跨特征的均衡生成性能,并优化了模型容量在特征和扩散时间上的分配。我们的实验结果表明,CDTD 始终优于 SOTA 基准模型,异常出色地捕获特征相关性,并且噪声调度设计中的异构性提升了样本质量。复现代码可在 https://github.com/muellermarkus/cdtd 获取。

关键词

引用

@article{arxiv.2312.10431,
  title  = {Continuous Diffusion for Mixed-Type Tabular Data},
  author = {Markus Mueller and Kathrin Gruber and Dennis Fok},
  journal= {arXiv preprint arXiv:2312.10431},
  year   = {2026}
}

备注

published at ICLR 2025