缺失数据情形下的变分自编码器
机器学习
2021-03-23 v3 机器学习
摘要
真实世界的数据集通常包含带有缺失项的条目,例如在医疗数据集中,一名患者不太可能做过所有可能的诊断检测。变分自编码器(VAEs)是流行的生成模型,常用于无监督学习。尽管它们被广泛使用,目前仍不清楚如何最好地将 VAE 应用于带有缺失数据的数据集。我们开发了一种生成缺失数据的污染过程的新型潜变量模型,并推导了相应的易处理证据下界(ELBO)。我们的模型易于实现,能处理完全随机缺失(MCAR)和非随机缺失(MNAR)数据,可扩展到高维输入,并让 VAE 编码器和解码器都能以有原则的方式访问指示变量以判断某个数据元素是否缺失。在 MNIST 和 SVHN 数据集上,与现有方法相比,我们展示了观测数据的边际对数似然有所提升,且缺失数据插补更优。
引用
@article{arxiv.2006.05301,
title = {VAEs in the Presence of Missing Data},
author = {Mark Collier and Alfredo Nazabal and Christopher K. I. Williams},
journal= {arXiv preprint arXiv:2006.05301},
year = {2021}
}
备注
Accepted to ICML Workshop on the Art of Learning with Missing Values (Artemiss), 17 July 2020