自举你自己的正样本:基于电子健康记录数据的对比学习
机器学习
2021-04-08 v1 人工智能
计算机与社会
摘要
电子健康记录(EHR)数据在医疗人工智能(AI)中如预测未来临床事件等方面具有巨大效用。然而,由于包括类不平衡与数据异质性(即复杂的类内方差)等诸多因素,使用经典机器学习模型时这些任务常面临许多挑战。为弥补部分研究空白,本文利用新兴的对比学习框架,提出了一种新颖的对比正则化临床分类模型。研究发现对比损失可显著增强基于 EHR 的预测:它以“推-拉”形式有效刻画相似/不相似模式,同时通过学习更均衡的特征空间缓解高度倾斜的类分布(近期研究亦印证此点)。特别地,当将对比学习直接套用于 EHR 数据时,一大障碍在于正样本的生成,因为 EHR 数据不如图像数据那样易于数据增强。为此,我们引入了两种专为 EHR 数据定制的独特正采样策略:基于特征的正采样,利用特征空间邻域结构强化特征学习;以及基于属性的正采样,结合预生成的患者相似度度量来定义样本邻近性。两种采样方法均考虑到 EHR 数据中独特的高类内方差。我们的整体框架在预测真实世界 COVID-19 EHR 数据(共 5,712 名入住大型城市医疗系统的患者)的死亡风险上取得了极具竞争力的实验结果。具体而言,我们的方法达到 0.959 的高 AUROC 预测分数,优于其他基线及替代方案:交叉熵(0.873)与 focal loss(0.931)。
引用
@article{arxiv.2104.02932,
title = {Bootstrapping Your Own Positive Sample: Contrastive Learning With Electronic Health Record Data},
author = {Tingyi Wanyan and Jing Zhang and Ying Ding and Ariful Azad and Zhangyang Wang and Benjamin S Glicksberg},
journal= {arXiv preprint arXiv:2104.02932},
year = {2021}
}