ELMV:一种用于分析含显著缺失值的电子健康记录的集成学习方法
机器学习
2020-11-04 v2 机器学习
摘要
许多真实世界的电子健康记录(EHR)数据含有大比例的缺失值。若大量缺失信息未被处理,通常会导致显著偏倚,从而得出无效结论。另一方面,用小得多的近完整子集训练机器学习模型会严重影响模型推断的可靠性和准确性。试图以有意义的值替换缺失数据的数据插补算法不可避免地增加了效应估计的变异性(随缺失程度增加而加剧),使其对假设验证不可靠。我们提出一种新颖的缺失值集成学习(ELMV)框架,其引入一种有效方法构建原始 EHR 数据中缺失率更低的多子集,并调动专用支持集进行集成学习,以减少由大量缺失值引起的偏倚。ELMV 已在真实世界医疗数据上用于关键特征识别,以及在一批具不同缺失率的模拟数据上用于结局预测。两项实验中,ELMV 均明显优于常规缺失值插补方法和集成学习模型。
引用
@article{arxiv.2006.14942,
title = {ELMV: an Ensemble-Learning Approach for Analyzing Electrical Health Records with Significant Missing Values},
author = {Lucas J. Liu and Hongwei Zhang and Jianzhong Di and Jin Chen},
journal= {arXiv preprint arXiv:2006.14942},
year = {2020}
}
备注
15 pages, 8 Figures, Typos corrected, Accepted to ACM-BCB 2020