BioMegatron:更大的生物医学领域语言模型
计算与语言
2020-10-15 v2
摘要
生物医学领域专用语言模型大量涌现,表明在生物医学文本上预训练的语言模型在生物医学领域基准上优于在如维基百科与书籍等通用领域文本语料上训练的模型。然而,多数工作未深入研究影响各领域语言应用的因素。此外,关于模型规模对领域专用模型影响的研究基本缺失。我们通过实证研究与评估若干可影响领域语言应用性能的因素,如子词词表、模型规模、预训练语料与领域迁移。我们的更大 BioMegatron 模型在更大领域语料上训练,在基准上展现出一致的提升,增进了对领域语言模型应用的理解。我们在命名实体识别、关系抽取与问答等标准生物医学 NLP 基准上展示了相较先前最先进(SOTA)水平的显著提升。模型检查点与代码见于 [https://ngc.nvidia.com] 与 [https://github.com/NVIDIA/NeMo]。
引用
@article{arxiv.2010.06060,
title = {BioMegatron: Larger Biomedical Domain Language Model},
author = {Hoo-Chang Shin and Yang Zhang and Evelina Bakhturina and Raul Puri and Mostofa Patwary and Mohammad Shoeybi and Raghav Mani},
journal= {arXiv preprint arXiv:2010.06060},
year = {2020}
}
备注
Accepted for publication at EMNLP 2020