关于共享电子健康记录基础模型适应性的多中心研究
机器学习
2024-04-24 v2 人工智能
摘要
基础模型有望通过提供易于适配下游医疗任务的模块化组件来变革医疗 AI,使 AI 开发更具可扩展性与成本效益。在数百万患者编码医疗记录上训练的结构化 EHR 基础模型已展现出诸多益处,包括以更少训练标签获得更高性能,以及针对分布偏移的更强鲁棒性。然而,关于跨不同医院共享这些模型的可行性及其本地任务适配性能,仍存在疑问。本多中心研究考察了近期发布的、在 257 万斯坦福医学(Stanford Medicine)患者纵向医疗记录数据上训练的结构化 EHR 基础模型 () 的适应性。实验使用 The Hospital for Sick Children 与 MIMIC-IV 的 EHR 数据开展。我们评估了通过本地数据持续预训练的适应性,以及与各站点从头训练模型(含一个本地基础模型)基线相比的任务适应性。我们在 8 项临床预测任务上评估了这些模型的性能。在两数据集中,适配现成的 匹配了基于全部数据本地训练的 GBM 模型性能,同时在任务特定训练标签较少的设置下带来 13% 的提升。借助本地数据持续预训练,标签效率大幅提升,使得 所需训练样本不足 1% 即可匹配完全训练的 GBM 性能。持续预训练相比从头训练本地基础模型还高出 60% 至 90% 的样本效率。我们的发现表明,跨医院适配共享 EHR 基础模型能以更低成本提供改良的预测性能,凸显了基础模型作为模块化组件简化医疗 AI 开发的作用。
引用
@article{arxiv.2311.11483,
title = {A Multi-Center Study on the Adaptability of a Shared Foundation Model for Electronic Health Records},
author = {Lin Lawrence Guo and Jason Fries and Ethan Steinberg and Scott Lanyon Fleming and Keith Morse and Catherine Aftandilian and Jose Posada and Nigam Shah and Lillian Sung},
journal= {arXiv preprint arXiv:2311.11483},
year = {2024}
}
备注
46 pages, 5 figures, 3 tables, 14 appendices