PaReGTA:一种基于LLM的EHR数据编码方法以捕获时间信息
机器学习
2026-03-03 v2
摘要
结构化电子健康记录(EHR)中的时间信息常常在稀疏的独热编码或基于计数的表示中丢失,而序列模型可能成本高昂且数据需求量大。我们提出PaReGTA,一种基于大语言模型(LLM)的编码框架,它能够(i)将纵向EHR事件转换为带有显式时间线索的访视级模板文本,(ii)通过对句子嵌入模型进行轻量级对比微调来学习领域适应的访视嵌入,以及(iii)使用混合时间池化将访视嵌入聚合成固定维度的患者表示,该池化能同时捕获近期和全局信息性访视。由于PaReGTA不需要从头开始训练,而是利用预训练的LLM,因此即使在数据有限的队列中也能表现良好。此外,PaReGTA是模型无关的,并且可以受益于未来专门用于EHR的句子嵌入模型。为了可解释性,我们引入了PaReGTA-RSS(表示偏移分数),它通过在目标因子移除后重新计算表示,并通过机器学习模型投影表示偏移,来量化临床定义因子的重要性。在来自“我们所有人”研究计划的39,088名偏头痛患者中,PaReGTA在偏头痛类型分类上优于稀疏基线模型,而深度序列模型在我们的队列中不稳定。
引用
@article{arxiv.2602.19661,
title = {PaReGTA: An LLM-based EHR Data Encoding Approach to Capture Temporal Information},
author = {Kihyuk Yoon and Lingchao Mao and Catherine Chong and Todd J. Schwedt and Chia-Chun Chiang and Jing Li},
journal= {arXiv preprint arXiv:2602.19661},
year = {2026}
}
备注
26 pages, 5 figures, 7 tables