MissDiff:在含缺失值的表格数据上训练扩散模型
机器学习
2023-07-04 v1 机器学习
摘要
扩散模型在建模数据分布与合成数据方面表现出卓越性能。然而,原始扩散模型需要完整或完全观测的数据进行训练。不完整数据在包括医疗与金融在内的多种真实应用中有常见问题,尤其在处理表格数据集时。本工作提出了一个统一且基于原则的扩散框架,用于在各种缺失机制下从含缺失值的数据中学习。我们首先观察到被广泛采用的“先插补后生成”流程可能导致有偏的学习目标。随后我们提出在训练阶段掩蔽去噪分数匹配(Denoising Score Matching)的回归损失。我们证明所提方法在学习数据分布分数上是一致的,且所提训练目标在特定情况下作为负似然的上界。所提框架在多个表格数据集上使用真实有效的指标进行了评估,并被证明以较大优势优于采用“先插补后生成”流程的表格数据最优扩散模型。
引用
@article{arxiv.2307.00467,
title = {MissDiff: Training Diffusion Models on Tabular Data with Missing Values},
author = {Yidong Ouyang and Liyan Xie and Chongxuan Li and Guang Cheng},
journal= {arXiv preprint arXiv:2307.00467},
year = {2023}
}
备注
22 pages, short version is accepted by ICML workshop on Structured Probabilistic Inference & Generative Modeling 2023