中文

面向生物医学自然语言处理的领域专用语言模型预训练

计算与语言 2021-09-20 v6 机器学习

摘要

预训练大型神经语言模型(如 BERT)已在许多自然语言处理(NLP)任务上带来显著提升。然而,大多数预训练工作聚焦于通用领域语料,如新闻电讯与 Web。一种普遍假设是,即便进行领域专用预训练,也可通过从通用领域语言模型起步而获益。本文挑战这一假设,表明对于拥有丰富无标注文本的领域(如生物医学),从零开始预训练语言模型相比对通用领域语言模型持续预训练可带来大幅增益。为推进该探究,我们从公开数据集合成了全面的生物医学 NLP 基准。实验表明,领域专用预训练可作为广泛生物医学 NLP 任务的坚实基础,并在各项任务上取得全新的 state-of-the-art 结果。此外,在对预训练与任务特定微调的建模选择进行透彻评估时,我们发现某些常见做法在 BERT 模型中并非必要,例如命名实体识别(NER)中使用复杂标注方案。为助力生物医学 NLP 研究加速,我们已发布达到 state-of-the-art 的预训练与任务特定模型,并创建了以 BLURB 基准(Biomedical Language Understanding & Reasoning Benchmark 的简称)为特色的排行榜,网址为 https://aka.ms/BLURB。

关键词

引用

@article{arxiv.2007.15779,
  title  = {Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing},
  author = {Yu Gu and Robert Tinn and Hao Cheng and Michael Lucas and Naoto Usuyama and Xiaodong Liu and Tristan Naumann and Jianfeng Gao and Hoifung Poon},
  journal= {arXiv preprint arXiv:2007.15779},
  year   = {2021}
}

备注

ACM Transactions on Computing for Healthcare (HEALTH)