基于双掩码自编码的不完整电子健康记录数据表征学习
机器学习
2026-02-18 v1
摘要
从电子健康记录(EHR)时间序列中学习具有挑戰性,因为存在不规则采样、异构缺失以及导致观测稀疏的结果。先前的自监督方法要么在学习前进行插值,要么通过专用输入信号表示缺失性,要么仅针对插值进行优化,从而降低了有效学习支持临床下游任务表征的能力。我们提出了增强-内在双掩码自编码器(Augmented-Intrinsic Dual-Masked Autoencoder, AID-MAE),该方法通过对自然缺失值应用内在缺失掩码来表示,并通过隐藏一部分已观察值用于重建来应用增强掩码进行训练。AID-MAE仅处理未被掩码覆盖的子集标记,跨越多个临床任务在两个数据集上 consistently 优于强大的基线,包括 XGBoost 和 DuETT。此外,所学习的嵌入自然地对患者队列在表征空间中进行分层。
引用
@article{arxiv.2602.15159,
title = {Learning Representations from Incomplete EHR Data with Dual-Masked Autoencoding},
author = {Xiao Xiang and David Restrepo and Hyewon Jeong and Yugang Jia and Leo Anthony Celi},
journal= {arXiv preprint arXiv:2602.15159},
year = {2026}
}
备注
10 pages, 4 figures