医疗AI的泛化能力:临床大语言模型的评估
计算与语言
2024-02-27 v2 计算机与社会
机器学习
摘要
大语言模型(LLMs)的进步为医疗保健领域带来了新的机遇,包括改善患者护理、临床决策以及优化医生和管理人员的工作流程。然而,这些模型的潜力在很大程度上取决于它们能否在临床环境和人群中有效泛化,这一挑战在早期开发中往往被低估。为了更好地理解这些挑战的原因并为缓解方法提供信息,我们评估了ClinicLLM,这是一个在[HOSPITAL]临床笔记上训练的LLM,分析了其在30天全因再入院预测任务上的性能,重点关注不同医院和患者特征之间的变异性。我们发现,在样本量较少的医院、政府保险和未指定保险的患者、老年人以及合并症较多的患者中,泛化能力较差。为了理解泛化能力不足的原因,我们研究了微调的样本量、笔记内容(每篇笔记的字数)、患者特征(合并症水平、年龄、保险类型、行政区)以及医疗系统方面(医院、30天全因再入院率和死亡率)。我们使用描述性统计和监督分类来识别特征。我们发现,除了样本量之外,患者年龄、合并症数量以及笔记中的字数都是与泛化相关的重要因素。最后,我们比较了局部微调(针对特定医院)、基于实例的增强微调和基于聚类的微调,以改进泛化。其中,局部微调被证明是最有效的,将AUC提高了0.25%到11.74%(在数据有限的环境中最为有用)。总体而言,这项研究为在医疗保健这一具有重要社会意义的领域中增强大语言模型的部署,并提高其在更广泛人群中的性能提供了新的见解。
引用
@article{arxiv.2402.10965,
title = {Generalization in Healthcare AI: Evaluation of a Clinical Large Language Model},
author = {Salman Rahman and Lavender Yao Jiang and Saadia Gabriel and Yindalon Aphinyanaphongs and Eric Karl Oermann and Rumi Chunara},
journal= {arXiv preprint arXiv:2402.10965},
year = {2024}
}