处理医疗数据中的缺失值:基于深度学习的填补技术系统综述
机器学习
2024-06-11 v1
摘要
目的:妥善处理缺失值对于提供可靠的估计与决策至关重要,尤其在临床研究等高风险领域。数据日益多样化和复杂化,促使许多研究者开发基于深度学习(DL)的填补技术。我们进行了一次系统综述以评估这些技术的使用,特别关注数据类型,旨在帮助来自不同学科的医疗研究者处理缺失值。方法:我们检索了五个数据库(MEDLINE、Web of Science、Embase、CINAHL 和 Scopus)中 2021 年 8 月之前发表、应用基于 DL 的模型进行填补的文章。我们从四个角度评估入选文献:健康数据类型、模型主干(即主要架构)、填补策略以及与基于非 DL 方法的比较。基于数据类型,我们制作了一幅证据地图以说明 DL 模型的采用情况。结果:我们纳入 64 篇文章,其中表格静态数据(26.6%,17/64)和时间序列数据(37.5%,24/64)被研究得最为频繁。我们发现模型主干随数据类型以及填补策略而异。“集成”策略,即填补任务与下游任务同时解决,在表格时间数据(50%,12/24)和多模态数据(71.4%,5/7)中很流行,但在其他数据类型中有限。此外,与基于非 DL 的方法相比,基于 DL 的填补方法在大多数研究中产生了更好的填补精度。结论:基于 DL 的填补模型可按数据类型定制,以应对相应的缺失模式,其相关的“集成”策略可提升填补效能,尤其在数据复杂的场景中。未来研究可关注基于 DL 的模型在医疗数据填补中的可移植性与公平性。
引用
@article{arxiv.2210.08258,
title = {Handling missing values in healthcare data: A systematic review of deep learning-based imputation techniques},
author = {Mingxuan Liu and Siqi Li and Han Yuan and Marcus Eng Hock Ong and Yilin Ning and Feng Xie and Seyed Ehsan Saffari and Victor Volovici and Bibhas Chakraborty and Nan Liu},
journal= {arXiv preprint arXiv:2210.08258},
year = {2024}
}