中文

大型语言模型是强大的电子健康记录编码器

机器学习 2026-04-15 v5 人工智能 计算与语言

摘要

电子健康记录(EHRs)为临床预测提供了巨大潜力,但其复杂性和异构性给传统机器学习带来了挑战。在未标记 EHR 数据上训练的领域特定 EHR 基础模型已显示出更高的预测准确性和泛化能力。然而,其发展受到数据访问受限和特定站点词汇表的制约。我们通过将医学代码替换为自然语言描述,将 EHR 数据转换为纯文本,使通用大型语言模型(LLMs)能够在不访问私有医学训练数据的情况下,为下游预测任务生成高维嵌入。在 EHRSHOT 基准的 15 项临床任务中,基于 LLM 的嵌入与专门的 EHR 基础模型 CLMBR-T-Base 表现相当。在使用 UK Biobank 进行外部验证时,基于 LLM 的模型在某些任务上显示出统计学上的显著改善,我们将此归因于更高的词汇覆盖率和略好的泛化能力。总体而言,我们揭示了专门 EHR 模型的计算效率与基于 LLM 嵌入的可移植性和数据独立性之间的权衡。

关键词

引用

@article{arxiv.2502.17403,
  title  = {Large Language Models are Powerful Electronic Health Record Encoders},
  author = {Stefan Hegselmann and Georg von Arnim and Tillmann Rheude and Noel Kronenberg and David Sontag and Gerhard Hindricks and Roland Eils and Benjamin Wild},
  journal= {arXiv preprint arXiv:2502.17403},
  year   = {2026}
}