中文

论临床报告标注的收益递减现象

计算与语言 2020-10-29 v1

摘要

大量证据表明,在非医学领域的自然语言处理(NLP)问题上,通过训练于越来越大的数据集,可以稳步获得更好的机器学习模型。同样的情况是否适用于医学 NLP 迄今尚未得到彻底研究。本工作表明这确实并非总是如此。我们揭示了一个有些反直觉的观察:性能良好的医学 NLP 模型可以用少量的标注数据获得,这与普遍看法恰恰相反,很可能是由于该问题的领域特异性。我们在由两大公开胸部 X 射线放射学报告数据集组成的固定测试集上,定量展示了训练数据规模在异常分类任务上的影响。所训练的模型不仅高效地利用了训练数据,而且以显著优势超越了当前最先进的基于规则的系统。

关键词

引用

@article{arxiv.2010.14587,
  title  = {On the diminishing return of labeling clinical reports},
  author = {Jean-Baptiste Lamare and Tobi Olatunji and Li Yao},
  journal= {arXiv preprint arXiv:2010.14587},
  year   = {2020}
}

备注

Accepted at the EMNLP 2020 Clinical NLP workshop, 9 pages + 2 for references, 7 figures, 4 tables