CheXpert++:逼近 CheXpert 标注器以实现速度、可微性与概率输出
机器学习
2020-06-30 v1 机器学习
摘要
获取医疗数据的真值标签通常不可行或不可能。为规避此问题,人们可构建基于规则或其他专家知识驱动的标注器,以在无任何真值训练数据的情况下处理数据并产出银标签。一个流行的此类标注器是 CheXpert,它为胸部 X 光放射报告生成诊断标签。CheXpert 非常有用,但计算相对缓慢,尤其在与端到端神经管道集成时;它是不可微的,因此无法用于任何需要梯度流经标注器的应用;并且它不产生概率输出,这限制了我们通过主动学习等技术提升银标注器质量的能力。本工作中,我们用 (一种基于 BERT 的、对 CheXpert 的高保真近似)解决了所有这三个问题。 与 CheXpert 达成 99.81% 的一致性,意味着它可可靠地用作 CheXpert 的即插即用替代,同时显著更快、完全可微且输出为概率形式。对 的误差分析还表明, 倾向于实际纠正 CheXpert 标签中的错误,在除一种疾病任务外的所有任务上,临床医生更常偏好 标签而非 CheXpert 标签(当二者不一致时)。为进一步展示该模型这些优势的作用,我们进行了一项概念验证主动学习研究,表明通过一轮主动学习启发的再训练,我们能在专家标注的报告句子随机子集上较原始未改动的 CheXpert 提升约 8% 的准确率。这些发现表明,协同学习与主动学习中的简单技术可在最小且可控的人类标注需求下产出高质量标注器。
引用
@article{arxiv.2006.15229,
title = {CheXpert++: Approximating the CheXpert labeler for Speed,Differentiability, and Probabilistic Output},
author = {Matthew B. A. McDermott and Tzu Ming Harry Hsu and Wei-Hung Weng and Marzyeh Ghassemi and Peter Szolovits},
journal= {arXiv preprint arXiv:2006.15229},
year = {2020}
}
备注
To appear at MLHC 2020