基于重要性加权自编码器的非忽略缺失数据无监督插补
机器学习
2022-06-22 v3 应用统计
摘要
近年来,深度学习方法(DL)的流行度急剧上升。虽然其最初的成功体现在图像数据的分类与处理上,但DL方法在生物医学科学问题中的应用已显著增长。然而,生物医学数据集中更高普遍性与复杂性的缺失数据给DL方法带来了重大挑战。在此,我们在变分自编码器(VAEs)的背景下对缺失数据进行形式化处理,VAE是一种流行的无监督DL架构,常用于降维、插补以及学习复杂数据的潜在表示。我们提出了一种新的VAE架构NIMIWAE,它是首批能在训练时灵活考虑输入特征中可忽略与非忽略缺失模式的架构之一。训练后,可从缺失数据的近似后验分布中抽样,用于多重插补,从而促进高维不完整数据集的下游分析。我们通过统计模拟证明,我们的方法在无监督学习任务和插补精度上优于现有方法。最后,我们以一项涉及12,000名ICU患者的电子健康记录(EHR)数据集案例研究作结,该数据集包含大量诊断测量与临床结局,其中许多特征仅被部分观测。
引用
@article{arxiv.2101.07357,
title = {Unsupervised Imputation of Non-ignorably Missing Data Using Importance-Weighted Autoencoders},
author = {David K. Lim and Naim U. Rashid and Junier B. Oliva and Joseph G. Ibrahim},
journal= {arXiv preprint arXiv:2101.07357},
year = {2022}
}
备注
31 pages, 4 figures, 2 tables, under review (Biometrics Methodology)