论使用大语言模型增强电子健康记录中临床驱动的缺失数据恢复算法
机器学习
2025-10-07 v1 应用统计
统计方法学
摘要
目的:电子健康记录(EHR)数据容易出现缺失和错误。此前,我们设计了一种“丰富化”的病历审查协议,其中使用辅助诊断(锚点)的“路线图”来恢复 EHR 数据中的缺失值(例如,糖耐量受损的诊断可能意味着缺失的糖化血红蛋白 A1c 值应被视为不健康)。尽管如此,病历审查昂贵且耗时,这限制了可以审查数据的患者数量。现在,我们研究了一种基于 ICD-10 代码(国际疾病分类第 10 次修订本)的路线图驱动算法的准确性和可扩展性,以模拟专家病历审查并恢复缺失值。材料与方法:除了我们先前工作中临床医生提供的原始路线图外,我们还考虑了结合临床专业知识使用大语言模型(LLM)迭代细化以扩展辅助诊断列表的新版本。使用来自一个大型学习型健康系统的 EHR 中 100 名患者的病历审查,我们检验了不同路线图下算法的性能。在针对 名患者的更大规模研究中,我们应用了最终算法,该算法使用了包含经临床医生认可的 LLM 补充内容的路线图。结果:根据路线图的不同,该算法恢复的缺失数据量与专家病历审查员一样多,甚至更多。讨论:由临床驱动的算法(经 LLM 增强)能够以与病历审查相似的准确度恢复缺失的 EHR 数据,并且可以切实应用于大样本。将其扩展以监测数据质量的其他维度(例如,合理性)是一个有前景的未来方向。
引用
@article{arxiv.2510.03844,
title = {On Using Large Language Models to Enhance Clinically-Driven Missing Data Recovery Algorithms in Electronic Health Records},
author = {Sarah C. Lotspeich and Abbey Collins and Brian J. Wells and Ashish K. Khanna and Joseph Rigdon and Lucy D'Agostino McGowan},
journal= {arXiv preprint arXiv:2510.03844},
year = {2025}
}