中文

基于预训练语言模型与知识蒸馏的放射学检查协议自动分配

计算与语言 2021-07-08 v3

摘要

选择放射学检查协议是一个重复且耗时的过程。本文中,我们提出一种深度学习方法,通过预训练一个领域特定的 BERT 模型(BERTradBERT_{rad})来自动为计算机断层扫描检查分配协议。为处理检查协议间严重的数据不平衡,我们采用了一种知识蒸馏方法,通过数据增强对少数类进行上采样。我们将所述方法的分类性能与使用支持向量机(SVM)、梯度提升机(GBM)和随机森林(RF)分类器以及 Google 的 BERTbaseBERT_{base} 模型的统计 n-gram 模型进行比较。SVM、GBM 和 RF 的宏平均 F1 分数分别为 0.45、0.45 和 0.6,而 BERTbaseBERT_{base}BERTradBERT_{rad} 分别为 0.61 和 0.63。知识蒸馏提升了少数类上的整体性能,取得了 0.66 的 F1 分数。

关键词

引用

@article{arxiv.2009.00694,
  title  = {Automatic Assignment of Radiology Examination Protocols Using Pre-trained Language Models with Knowledge Distillation},
  author = {Wilson Lau and Laura Aaltonen and Martin Gunn and Meliha Yetisgen},
  journal= {arXiv preprint arXiv:2009.00694},
  year   = {2021}
}

备注

accepted at American Medical Informatics Association symposium 2021