利用跨医院标注与未标注数据的临床文档分类
计算与语言
2018-12-06 v2 机器学习
摘要
急诊科放射报告的审阅是一项必要但繁重的任务。对放射报告中异常病例的患者进行及时随访可能显著改变患者预后,尤其在他们以不同初始诊断出院的情况下。已有机器学习方法被设计以加速该过程并检测需立即随访的病例。然而,这些方法需要大量标注数据来训练可靠的预测模型。准备这样的大型数据集需由健康专业人员手动标注,成本高且耗时。本文研究了一种用于三家医院放射报告分类的半监督学习框架。主要目标是在标注数据有限时利用临床未标注数据以增强学习过程。为进一步提升分类性能,我们还将迁移学习技术整合进半监督学习流程。实验结果表明:(1) 卷积神经网络(CNNs)虽不依赖任何问题特定特征工程,但相比传统监督学习方法取得了显著更高的效能;(2) 在训练基于 CNN 的分类器时利用未标注数据,使达到同等全监督 CNN 性能对标注数据的依赖减少逾 50%;(3) 迁移外部源医院可用标注数据所获得的知识,显著提升了目标医院中半监督 CNN 模型相对于其全监督对应模型的性能。
引用
@article{arxiv.1812.00677,
title = {Clinical Document Classification Using Labeled and Unlabeled Data Across Hospitals},
author = {Hamed Hassanzadeh and Mahnoosh Kholghi and Anthony Nguyen and Kevin Chu},
journal= {arXiv preprint arXiv:1812.00677},
year = {2018}
}