基于蒙特卡洛 dropout 自编码器的生物医学数据多重插补
机器学习
2020-05-14 v1 机器学习
摘要
由于实验环境复杂,生物医学数据中缺失值十分常见。为解决此问题,已提出多种方法,从忽略不完整样本到各类数据插补方法。随着深度神经网络的兴起,缺失数据插补领域已转向对数据分布的建模。本文提出一种基于(变分)自编码器内蒙特卡洛 dropout 的方法,不仅可良好适配数据分布,还能针对每个具体样本生成新数据。评估表明,所提方法可降低插补误差并改善预测相似性。
引用
@article{arxiv.2005.06173,
title = {Multiple Imputation for Biomedical Data using Monte Carlo Dropout Autoencoders},
author = {Kristian Miok and Dong Nguyen-Doan and Marko Robnik-Šikonja and Daniela Zaharie},
journal= {arXiv preprint arXiv:2005.06173},
year = {2020}
}