注意缺失:面向不规则电子健康记录时间序列的变量感知表示学习的大语言模型
机器学习
2025-09-29 v1
摘要
不规则采样和高缺失率是建模源自电子健康记录(EHR)的时间序列的内在挑战,其中临床变量根据工作流和干预时机以不等间隔测量。为解决这一问题,本文提出了VITAL,一个面向从不规则采样生理时间序列中学习的变量感知大语言模型(LLM)框架。VITAL区分两种不同类型的临床变量:生命体征,其记录频繁且具有时间模式;以及实验室检验,其测量稀疏且缺乏时间结构。它将生命体征重新编程到语言空间,使LLM能够通过显式编码捕获时间上下文并对缺失值进行推理。相比之下,实验室变量根据其可用性,使用代表性汇总值或可学习的[Not measured]标记进行嵌入。在PhysioNet基准数据集上的广泛评估表明,VITAL优于专为不规则时间序列设计的最先进方法。此外,在高缺失率下它保持了鲁棒性能,这在关键变量经常不可用的真实临床场景中很常见。
引用
@article{arxiv.2509.22121,
title = {Mind the Missing: Variable-Aware Representation Learning for Irregular EHR Time Series using Large Language Models},
author = {Jeong Eul Kwon and Joo Heung Yoon and Hyo Kyung Lee},
journal= {arXiv preprint arXiv:2509.22121},
year = {2025}
}