使用辅助置信度标签的稀疏多维患者建模
机器学习
2015-07-30 v1
摘要
本工作中,我们关注学习一个在患者电子健康记录(EHRs)上进行推理的分类模型的问题。学习此类模型通常需要大量昂贵的专家监督。为降低此成本,我们获取置信度标签,指示专家对其提供的类标签的确信程度。若有意义的置信信息能融入学习方法,则可能需要标注更少的患者实例以学习准确模型。此外,尽管预测准确性对任何推理模型都很重要,但患者模型必须是可解释的,以便临床医生理解模型如何决策。为此,我们开发了一种名为 Confidence bAsed MEtric Learning (CAMEL) 的新颖度量学习方法,其支持纳入置信度标签,并以三种方式强调可解释性。第一,我们的方法诱导稀疏性,从而产生仅使用患者EHR中少数特征的简单模型。第二,CAMEL自然产生置信分数,可供临床医生在制定治疗决策时考虑。第三,CAMEL学习的度量诱导多维空间,其中每个维度代表临床医生可用于评估患者的不同“因子”。在我们的实验评估中,我们在真实世界临床数据集上展示我们的CAMEL方法能够学习到与使用相同监督的其他方法一样或更准确的模型。此外,我们展示当CAMEL使用置信分数时,仅使用10%的训练实例就能学习到与我们测试的其他方法一样或更准确的模型。最后,我们对CAMEL学习的度量进行定性评估,显示其识别并清晰阐明模型进行推理的重要因子。
引用
@article{arxiv.1507.07955,
title = {Sparse Multidimensional Patient Modeling using Auxiliary Confidence Labels},
author = {Eric Heim and Milos Hauskrecht},
journal= {arXiv preprint arXiv:1507.07955},
year = {2015}
}
备注
Currently under review