基于带噪标签EHR数据预测早产的交替损失校正方法
机器学习
2018-12-07 v1 人工智能
机器学习
摘要
本文关注基于纵向EHR诊断代码预测早产的问题。我们将该预测问题表述为带有噪声标签的监督分类问题。我们的基础分类器是带有注意力机制的循环神经网络。我们假设存在一个同时具有噪声标签和干净标签的数据子集。对于队列定义,母亲记录中与妊娠相关的大多数诊断代码在定义足月与早产类别时是模糊的。另一方面,婴儿记录中的诊断代码提供了关于早产的细粒度信息。由于数据去标识化,母亲与婴儿之间的关联不可用。我们开发了一种基于入院和出院时间的启发式方法,将婴儿与其母亲进行匹配,从而用分娩状态的附加信息丰富母亲记录。从匹配启发式方法获得的附加数据集具有噪声标签,并被用于辅助深度学习模型的训练。我们提出一种交替损失校正(ALC)方法,利用干净与噪声标签共同训练深度模型。首先,使用同时具有噪声和干净标签的数据子集估计标签损坏矩阵。然后将其作为密集输出层用于模型中以校正标签噪声。该网络在采用简单交叉熵损失的干净数据集上训练若干个周期,并在下一周期采用噪声数据集和用估计损坏矩阵校正的损失交替训练。在分娩前90天预测早产的实验表明,与基线及最先进方法相比性能有所提升。
引用
@article{arxiv.1811.09782,
title = {Alternating Loss Correction for Preterm-Birth Prediction from EHR Data with Noisy Labels},
author = {Sabri Boughorbel and Fethi Jarray and Neethu Venugopal and Haithum Elhadi},
journal= {arXiv preprint arXiv:1811.09782},
year = {2018}
}
备注
Submission Id: 79, Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216