用于表格数据缺失值填补的扩散模型
机器学习
2023-03-14 v2 人工智能
摘要
机器学习中的缺失值填补任务是利用可用信息准确估计数据集中的缺失值。在该任务中,已有若干深度生成建模方法被提出并展现了其效用,例如生成对抗填补网络。近来,扩散模型因在图像、文本、音频等生成建模任务中的有效性而广受欢迎。据我们所知,关于扩散模型在表格数据缺失值填补中有效性的研究较少受到关注。基于近期针对时间序列数据填补的扩散模型进展,我们提出了一种称为“表格数据条件分数扩散模型” (TabCSDI) 的扩散模型方法。为有效同时处理类别变量与数值变量,我们研究了三种技术:独热编码、模拟比特编码与特征分词化。在基准数据集上的实验结果证明了 TabCSDI 相对于已知现有方法的有效性,并强调了类别嵌入技术的重要性。
引用
@article{arxiv.2210.17128,
title = {Diffusion models for missing value imputation in tabular data},
author = {Shuhan Zheng and Nontawat Charoenphakdee},
journal= {arXiv preprint arXiv:2210.17128},
year = {2023}
}
备注
Accepted to Table Representation Learning Workshop at NeurIPS 2022. Renamed proposed method name to TabCSDI