医学暗物质中隐藏着什么?医疗实践中的缺失数据学习
机器学习
2024-02-12 v1 人工智能
计算与语言
人机交互
信息论
math.IT
摘要
电子病历(EPRs)产生了丰富的数据,但包含大量缺失信息。理解和处理这些缺失数据是临床数据分析的重要组成部分,若不予解决,可能导致分析偏差并扭曲关键结论。缺失数据可能与医疗保健专业人员的实践模式相关,而对缺失数据进行插补可提高临床决策的有效性。本研究侧重于理解和解释缺失数据的统计方法,以及基于机器学习的临床数据插补,使用了单一中心的儿科急诊数据和英国最大创伤损伤数据库(TARN)的临床审计数据。在对 56,961 个与急诊科儿童初诊生命体征和观察值相关的数据点的研究中,我们表明缺失数据很可能是非随机的,并且与医疗保健专业人员的实践模式相关联。随后,我们检查了 5,791 例创伤病例中 79 个存在缺失值的 TARN 字段。我们使用了基于奇异值分解(SVD)和 k 近邻(kNN)的缺失数据插补方法,并将插补结果与原始数据集进行了比较和统计检验。我们得出结论,1NN 插补器是最佳的插补方法,这表明了一种常见的临床决策模式:找到最相似的患者并将其属性作为插补值。
引用
@article{arxiv.2402.06563,
title = {What is Hiding in Medicine's Dark Matter? Learning with Missing Data in Medical Practices},
author = {Neslihan Suzen and Evgeny M. Mirkes and Damian Roland and Jeremy Levesley and Alexander N. Gorban and Tim J. Coats},
journal= {arXiv preprint arXiv:2402.06563},
year = {2024}
}
备注
8 pages