图变换器在纵向电子健康记录预测中的翻译差距:对 GT-BEHRT 的批判性评估
摘要
基于大规模自监督预训练,Transformer-based 模型在纵向电子健康记录上的预测建模方面取得了改进。然而,大多数 EHR Transformer 架构将每个临床接触视为无序的代码集合,这限制了其捕获单个访问内有意义关系的能力。图变换器方法旨在通过建模访问级别的结构,同时保留学习长期时间模式的能力来解决此限制。本文对 GT-BEHRT—a 用于评估 MIMIC-IV 重症监护 outcomes 和 All of Us 研究计划中心血管病预测的图变换器架构进行了批判性评论。我们检验报告的性能提升是否反映出真正的架构优势,以及评估方法是否支持鲁棒性和临床相关性的声称。我们对 GT-BEHRT 进行了七个维度的分析,这些维度与现代机器学习系统的相关,包括表示设计、预训练策略、队列构建透明度、超越判别的评估、公平性评估、可重复性和部署可行性。GT-BEHRT 在 365 天内的心血管病预测中报告了强大的判别性能,AUROC 为94.37 +/- 0.20,AUPRC 为73.96 +/- 0.83,F1 为64.70 +/- 0.85。尽管如此,我们确定了几个重要的差距,包括缺乏校准分析、不完整的公平性评估、对队列选择的敏感性、对表现型和预测时段的有限分析,以及对实际部署考虑的有限讨论。总体而言,GT-BEHRT 代表了电子健康记录表示学习中的有意义的架构进步,但在校准、公平性和部署方面需要更严格的评估,才能在之前的模型可靠支持临床决策。
引用
@article{arxiv.2603.13231,
title = {Translational Gaps in Graph Transformers for Longitudinal EHR Prediction: A Critical Appraisal of GT-BEHRT},
author = {Krish Tadigotla},
journal= {arXiv preprint arXiv:2603.13231},
year = {2026}
}
备注
A critical review of graph transformer models for longitudinal electronic health records, discussing evaluation practices, calibration, fairness, and clinical relevance. 5 pages