基于自编码器的电子健康记录表示学习:一项比较研究
机器学习
2019-09-23 v2 计算与语言
机器学习
摘要
近年来电子健康记录 (EHR) 数量的不断增长,为数据科学家通过将这些 EHR 临床数据应用于高级分析来合作开展医疗研究的各个方面提供了巨大机遇。然而一个关键要求是从高维、稀疏且复杂的临床数据中获取有意义的洞察。数据科学方法通常通过执行特征学习以从临床数据构建更可靠且信息丰富的特征表示,再进行监督学习来应对这一挑战。在本文中,我们提出了一种基于深度学习特征表示与词嵌入技术的预测建模方法。我们的方法使用不同的深度架构(栈式稀疏自编码器、深度信念网络、对抗自编码器和变分自编码器)进行更高层次抽象的特征表示,以从 EHR 中获取有效且鲁棒的特征,并在其上构建预测模型。当未标记数据丰富而标记数据稀缺时,我们的方法尤为有用。我们通过监督学习方法考察表示学习的性能。我们的重点在于呈现一项比较研究,以通过监督学习评估不同深度架构的性能,并为深度特征表示技术的选择提供见解。我们的实验表明,对于小数据集,栈式稀疏自编码器由于稀疏正则化在预测中展现出更优的泛化性能,而变分自编码器由于具备学习表示分布的能力,在大数据集上优于竞争方法。
引用
@article{arxiv.1908.09174,
title = {Representation Learning with Autoencoders for Electronic Health Records: A Comparative Study},
author = {Najibesadat Sadati and Milad Zafar Nezhad and Ratna Babu Chinnam and Dongxiao Zhu},
journal= {arXiv preprint arXiv:1908.09174},
year = {2019}
}
备注
Reason: This submission is the extension of our other research which has already submitted in arXiv (arXiv:1801.02961), therefore we decided update that version and withdraw this submission