用于医学报告细粒度分类的半监督自然语言方法
机器学习
2019-11-15 v2 计算与语言
机器学习
摘要
尽管机器学习已成为辅助医生进行临床分析的强大工具,但训练监督学习方法所需的海量标注数据使每项开发任务都成为耗时耗资源的重负。绝大多数密集的临床信息存储在书面报告中,详述了相关的患者信息。利用自然语言数据进行标准模型开发的挑战源于该模态的复杂性。本研究开发了一个模型流水线,采用无监督方法训练一个编码器——语言模型(一种循环网络)以生成文档编码;这些编码随后可用作特征输入到一个解码器——分类器模型中,该模型所需的标注数据量比以往方法少几个数量级,却能准确区分细粒度疾病类别。该语言模型在来自麻省总医院放射科(n=218,159)的未标注放射学报告上训练,终止时损失为1.62。分类模型在三个已标注的头部CT研究报告患者数据集上训练,分别为大血管闭塞(n=1403)、急性缺血性卒中(n=331)和颅内出血(n=4350),以直接从放射学报告数据中识别多种不同发现;大血管闭塞、急性缺血性卒中和颅内出血数据集的AUC分别为0.98、0.95和0.99。输出的编码能够与影像数据结合使用,以创建可处理多种不同模态的模型。从文本数据中自动提取相关特征的能力加快了模型开发并实现了文本模态的整合,总体上使临床报告成为更全面、更准确的深度学习模型中更可行的输入。
引用
@article{arxiv.1910.13573,
title = {Semi-Supervised Natural Language Approach for Fine-Grained Classification of Medical Reports},
author = {Neil Deshmukh and Selin Gumustop and Romane Gauriau and Varun Buch and Bradley Wright and Christopher Bridge and Ram Naidu and Katherine Andriole and Bernardo Bizzo},
journal= {arXiv preprint arXiv:1910.13573},
year = {2019}
}
备注
Accepted for IEEE publication & presented at MIT URTC