ICD 编码不足以创建机器学习数据集:基于 All of Us 数据的哨词菊病和心肌梗死评估
机器学习
2024-07-12 v1
摘要
在医学领域,机器学习(ML)数据集常常是使用国际疾病分类(ICD)编码构建的。随着新模型的不断开发,数据集规模的需求日益增长。然而,ICD 编码主要用于医疗费用结算,并非为数据集创建而设。本研究旨在评估 ICD 编码在训练机器学习模型数据集方面的适用性。我们选取了罕见病和常见病——哨词菊病(coccidioidomycosis, CM)和心肌梗死(myocardial infarction, MI)进行研究。首先,我们将使用 ICD 编码构建的哨词菊病患者队列与通过血清学确认识别的患者队列进行比较。其次,我们比较了两个类似构建方式的心肌梗死患者队列。我们发现这两组患者之间存在显著差异,且患者交叉重叠率较小。哨词菊病患者队列中,ICD-10 组共有 811 名患者,血清学阳性组有 619 名患者,两者同时符合者仅有 24 名。心肌梗死患者队列中,ICD-10 组有 14,875 名患者,实验室确诊组有 23,598 名患者,两者同时符合者为 6,531 名。在人口学特征、疾病症状发生率以及其他临床数据方面,我们的案例队列之间存在差异。
引用
@article{arxiv.2407.07997,
title = {ICD Codes are Insufficient to Create Datasets for Machine Learning: An Evaluation Using All of Us Data for Coccidioidomycosis and Myocardial Infarction},
author = {Abigail E. Whitlock and Gondy Leroy and Fariba M. Donovan and John N. Galgiani},
journal= {arXiv preprint arXiv:2407.07997},
year = {2024}
}
备注
Accepted at IEEE ICHI 2024 conference. Will be published in IEEE Xplore