结构化 EMR 轨迹中非规则采样的生成式预训练局限性
机器学习
2025-10-28 v1
摘要
基础模型指的是在大规模数据集上进行自回归预训练的架构,最初用于自然语言处理以捕获复杂的模式和构式。它们最初是为了将此类学习知识 transferred to downstream predictive tasks。最近,一些研究将这些已学习的表示重新用于表型发现,而缺乏严格的验证,风险是产生表面上逼真但临床上不连贯的嵌入。为测试这种不匹配,我们在纵向 ART 用于 HIV 和急性低血压数据集上训练了两个自回归模型——一个序列到序列 LSTM 和一个减小版 Transformer。通过随机 inter-visit 间隔引入训练过程中的控制不规则性,而测试序列保持完整。用于患者轨迹合成评估分布性和相关性保真度。两种模型都再现了特征分布,但未能保持跨特征结构——表明生成式预训练仅能实现局部真实感,而非临床连贯性。这些结果凸显了需要 domain-specific 评估的必要性,并支持轨迹合成作为 fine-tuning 或部署前的实用探针。
引用
@article{arxiv.2510.22878,
title = {Limits of Generative Pre-Training in Structured EMR Trajectories with Irregular Sampling},
author = {Nicholas I-Hsien Kuo and Blanca Gallego and Louisa Jorm},
journal= {arXiv preprint arXiv:2510.22878},
year = {2025}
}