中文

面向 EHR 时间序列数据的高效对比单模态预训练方法

机器学习 2024-10-15 v1

摘要

机器学习已彻底变革了临床时间序列数据的建模。使用机器学习,深度神经网络 (DNN) 可以自动学习其输入特征的复杂映射,以完成特定任务。这在电子健康记录 (EHR) 数据库中尤为宝贵,因为患者常常在重症监护病房 (ICU) 长期停留。机器学习是从数据中提取有价值信息的有效方法。然而,许多最先进 (SOTA) 方法训练 DNN 需要大量标记数据,这在诊所方面构成了巨大的挑战,涉及高昂成本和时间。自监督学习提供了一种替代方案,使实践者无需昂贵标签即可从数据中提取有价值见解。然而,当前的 SOTA 方法通常需要大数据批次才能实现最佳性能,增加了计算需求。这在处理长临床时间序列数据时 presents 挑战。为此,我们提出了一种针对长临床时间序列数据的高效对比预训练方法。我们的做法利用用于负面对比估计器,实现有效的特征提取。我们评估了使用标准自监督任务(如线性评估和半监督学习)的预训练效果。此外,我们的模型还能对缺失测量值进行插值,为临床医生提供更深入的患者病情洞察。我们演示了预训练在模型规模和测量词汇表规模均扩大时,能够实现更好的性能。最后,我们在 MIMIC-III 数据集上训练的模型经外部验证(使用 eICU 数据集),证明该模型能够学习能迁移到其他诊所的稳健临床信息。

关键词

引用

@article{arxiv.2410.09199,
  title  = {An Efficient Contrastive Unimodal Pretraining Method for EHR Time Series Data},
  author = {Ryan King and Shivesh Kodali and Conrad Krueger and Tianbao Yang and Bobak J. Mortazavi},
  journal= {arXiv preprint arXiv:2410.09199},
  year   = {2024}
}