中文

基于掩码自编码器的化验值表示学习

机器学习 2025-06-27 v3 人工智能

摘要

准确插补电子健康记录(EHR)中缺失的化验值,对于实现稳健的临床预测和减少医疗 AI 系统中的偏见至关重要。现有方法(如 XGBoost、softimpute、GAIN、期望最大化(EM) 和 MICE)难以建模 EHR 数据中复杂的时间与上下文依赖关系,尤其是在代表性不足的群体中。在本工作中,我们提出了 Lab-MAE,一种基于 Transformer 的掩码自编码器新框架,利用自监督学习对连续序列化验值进行插补。Lab-MAE 引入了一种结构化编码方案,联合建模化验值及其对应的时间戳,从而能够显式捕获时间依赖关系。在 MIMIC-IV 数据集上的实证评估表明,Lab-MAE 在均方根误差(RMSE)、决定系数(R2)和 Wasserstein 距离(WD)等多个指标上均显著优于 XGBoost、softimpute、GAIN、EM 和 MICE 等最先进的基线方法。值得注意的是,Lab-MAE 在不同人口统计学特征的患者群体中均实现了公平的性能,促进了临床预测的公平性。我们进一步研究了随访化验值作为潜在捷径特征的作用,揭示了 Lab-MAE 在此类数据不可用场景下的鲁棒性。研究结果表明,我们适应 EHR 数据特征的基于 Transformer 的架构,为更准确、更公平的临床插补提供了基础模型。此外,我们测量并比较了 Lab-MAE 与 XGBoost 模型的碳足迹,突出了其环境需求。

关键词

引用

@article{arxiv.2501.02648,
  title  = {Representation Learning of Lab Values via Masked AutoEncoders},
  author = {David Restrepo and Chenwei Wu and Yueran Jia and Jaden K. Sun and Jack Gallifant and Catherine G. Bielick and Yugang Jia and Leo A. Celi},
  journal= {arXiv preprint arXiv:2501.02648},
  year   = {2025}
}

备注

14 pages of main text, 11 appendix