构建面向特定疾病患者识别的 clinician-in-the-loop 机器学习分类器的可扩展工作流
计算与语言
2022-05-19 v1
摘要
临床医生可能依赖国际疾病分类(ICD)等医学编码系统从电子健康记录(EHRs)中识别患有疾病的患者。然而,由于细节与特异性的缺乏以及误编码的可能性,近期研究表明 ICD 代码往往无法在临床实践中准确刻画特定疾病的患者,因此用其寻找研究或试验患者会导致高失败率并遗漏未编码患者。大规模人工检查所有患者不可行,因其成本高且缓慢。本文提出一种可扩展工作流,利用 EHRs 中的结构化数据与非结构化文本笔记,结合 NLP、AutoML 及 clinician-in-the-loop 机制等技术,构建机器学习分类器以大规模识别患给定疾病的患者,尤其是那些当前被 ICD 代码误编码或遗漏者。在 MIMIC-III 数据集上进行了案例研究,所提工作流在金标准测试子集上识别卵巢癌(0.901 对 0.814)、肺癌(0.859 对 0.828)、癌症恶病质(0.862 对 0.650)和狼疮性肾炎(0.959 对 0.855)患者的 F1 分数分类性能均高于单纯使用 ICD 代码。此外,利用非结构化笔记的所提工作流始终优于仅用结构化数据的基线,F1 均有提升(卵巢癌 0.901 对 0.719,肺癌 0.859 对 0.787,癌症恶病质 0.862 对 0.838,狼疮性肾炎 0.959 对 0.785)。在大型测试集上的实验也表明所提工作流能找到更多被 ICD 代码误编码或遗漏的患者。此外,还进行了可解释性研究以从临床上验证分类器的顶级影响特征。
引用
@article{arxiv.2205.08891,
title = {A Scalable Workflow to Build Machine Learning Classifiers with Clinician-in-the-Loop to Identify Patients in Specific Diseases},
author = {Jingqing Zhang and Atri Sharma and Luis Bolanos and Tong Li and Ashwani Tanwar and Vibhor Gupta and Yike Guo},
journal= {arXiv preprint arXiv:2205.08891},
year = {2022}
}
备注
Under review