长上下文模型在电子健康记录上的临床预测:一项系统评估
机器学习
2025-03-20 v2 人工智能
计算工程、金融与科学
摘要
在电子健康记录(EHR)上训练的临床基础模型(FMs)已在众多临床预测任务上取得了最先进的成果。然而,现有EHR基础模型的上下文窗口通常小于1k个token,这阻碍了它们对可能包含超过10k个事件的完整患者EHR进行建模。近期在次二次长上下文架构(如Mamba)方面的进展提供了一个有前景的解决方案。然而,这些架构在EHR数据上的应用尚未得到充分研究。我们通过首次系统评估上下文长度对EHR数据建模的影响来填补这一空白。我们发现,更长的上下文长度能提升预测性能——我们基于Mamba的模型在EHRSHOT预测基准的14项任务中,有9项超越了先前的最先进水平。然而,对于临床应用而言,仅模型性能是不够的——对EHR数据独特属性的鲁棒性同样至关重要。因此,我们还评估了模型在EHR数据三个此前未被充分探索的属性上的表现:(1)“复制转发”诊断的普遍性,这会导致EHR序列中token的人为重复;(2)EHR事件间不规律的时间间隔,这可能导致上下文窗口内出现跨度极大的时间范围;(3)疾病复杂性随时间自然增加,使得EHR中较晚的token比较早的更难预测。通过对EHRSHOT结果进行分层分析,我们发现这些属性的更高水平与模型性能呈负相关,但更长的上下文模型对更极端的属性水平表现出更强的鲁棒性。我们的工作凸显了使用长上下文架构对EHR数据进行建模的潜力,并为识别源于自然语言之外领域的序列数据建模新挑战提供了一个案例。我们的模型和代码已发布在:https://github.com/som-shahlab/long_context_clues
关键词
引用
@article{arxiv.2412.16178,
title = {Context Clues: Evaluating Long Context Models for Clinical Prediction Tasks on EHRs},
author = {Michael Wornow and Suhana Bedi and Miguel Angel Fuentes Hernandez and Ethan Steinberg and Jason Alan Fries and Christopher Re and Sanmi Koyejo and Nigam H. Shah},
journal= {arXiv preprint arXiv:2412.16178},
year = {2025}
}