通用基础模型对医院运营而言不够临床化
计算与语言
2025-11-18 v1 人工智能
机器学习
摘要
医院和医疗系统依赖于决定患者流动、成本和护理质量的操作决策。尽管在医学知识和对话基准上表现强劲,但在通用文本上训练的基础模型可能缺乏这些操作决策所需的专业知识。我们引入了Lang1,这是一个在专门语料库上预训练的模型系列(100M-7B参数),该语料库混合了来自纽约大学朗格尼健康中心电子健康记录(EHR)的800亿个临床词元和来自互联网的6270亿个词元。为了在真实世界环境中严格评估Lang1,我们开发了真实医学评估(ReMedE),这是一个源自668,331份EHR记录的基准,用于评估五项关键任务:30天再入院预测、30天死亡率预测、住院时长、合并症编码以及预测保险索赔拒绝。在零样本设置中,通用和专用模型在五项任务中的四项上表现不佳(AUROC为36.6%-71.7%),死亡率预测是个例外。微调后,Lang1-1B优于大至70倍的微调通用模型和大至671倍的零样本模型,AUROC分别提高了3.64%-6.75%和1.66%-23.66%。我们还观察到跨任务扩展,即在多个任务上进行联合微调可改善其他任务的性能。Lang1-1B能有效迁移到分布外设置,包括其他临床任务和一个外部医疗系统。我们的发现表明,医院运营的预测能力需要明确的监督微调,并且通过领域内EHR预训练可以使该微调过程更高效。我们的发现支持了新兴观点,即专用大语言模型(LLM)可以在特定任务中与通用模型竞争,并表明有效的医疗系统人工智能需要领域内预训练、监督微调以及超越代理基准的真实世界评估的结合。
引用
@article{arxiv.2511.13703,
title = {Generalist Foundation Models Are Not Clinical Enough for Hospital Operations},
author = {Lavender Y. Jiang and Angelica Chen and Xu Han and Xujin Chris Liu and Radhika Dua and Kevin Eaton and Frederick Wolff and Robert Steele and Jeff Zhang and Anton Alyakin and Qingkai Pan and Yanbing Chen and Karl L. Sangwon and Daniel A. Alber and Jaden Stryker and Jin Vivian Lee and Yindalon Aphinyanaphongs and Kyunghyun Cho and Eric Karl Oermann},
journal= {arXiv preprint arXiv:2511.13703},
year = {2025}
}