中文

面向医疗机构规模的临床记录基础模型

机器学习 2025-07-02 v1

摘要

大规模预训练已在语言及其他数据类型建模中取得变革性进展,但在针对结构化电子健康记录(EHR)的医疗领域仍有潜力未被充分挖掘。我们提出了一种用于顺序EHR数据的创新性生成式预训练策略,基于下一访诊事件预测。该模型通过患者历史自动生成各种分词化临床事件,以预测下一次就诊,同时天然地处理异构数据类型的联合预测。此外,我们引入对重复事件预测的正则化,并指出EHR基础模型评估中的一个关键漏洞:若不区分新发事件与后续发生事件,重复事件标记会人为抬高性能指标。我们的模型通过零样本预测评估了2年和5年内预测痴呆及髋骨骨髓炎发病率的能力,模型性能与完全微调的掩码预训练Transformer基线相当,证明我们的方案无需昂贵的任务特定微调,即可捕获复杂的临床依赖关系。

关键词

引用

@article{arxiv.2507.00574,
  title  = {Foundation Models for Clinical Records at Health System Scale},
  author = {Haresh Rengaraj Rajamohan and Xiang Gao and Weicheng Zhu and Shih-Lun Huang and Long Chen and Kyunghyun Cho and Cem M. Deniz and Narges Razavian},
  journal= {arXiv preprint arXiv:2507.00574},
  year   = {2025}
}

备注

Accepted to ICML 2025 Workshop on Foundation Models for Structured Data