中文

BioBERT:用于生物医学文本挖掘的预训练生物医学语言表示模型

计算与语言 2019-10-21 v4

摘要

随着生物医学文献数量的快速增长,生物医学文本挖掘变得越来越重要。随着自然语言处理 (NLP) 的进步,从生物医学文献中提取有价值的信息受到了研究者的欢迎,而深度学习推动了有效生物医学文本挖掘模型的发展。然而,由于从通用领域语料库到生物医学语料库的词分布偏移,将 NLP 的进展直接应用于生物医学文本挖掘通常会产生不令人满意的结果。在本文中,我们研究了如何将最近引入的预训练语言模型 BERT 适应于生物医学语料库。我们引入了 BioBERT (Bidirectional Encoder Representations from Transformers for Biomedical Text Mining,用于生物医学文本挖掘的 Transformer 双向编码器表示),这是一个在大规模生物医学语料库上预训练的领域特定语言表示模型。在跨任务架构几乎相同的情况下,当在生物医学语料库上进行预训练时,BioBERT 在各种生物医学文本挖掘任务中大幅优于 BERT 和以前的最先进模型。虽然 BERT 获得了与以前最先进模型相当的性能,但 BioBERT 在以下三个具有代表性的生物医学文本挖掘任务上显著优于它们:生物医学命名实体识别 (F1 分数提高 0.62%)、生物医学关系抽取 (F1 分数提高 2.80%) 和生物医学问答 (MRR 提高 12.24%)。我们的分析结果表明,在生物医学语料库上预训练 BERT 有助于其理解复杂的生物医学文本。我们在 https://github.com/naver/biobert-pretrained 上免费提供 BioBERT 的预训练权重,并在 https://github.com/dmis-lab/biobert 上提供微调 BioBERT 的源代码。

关键词

引用

@article{arxiv.1901.08746,
  title  = {BioBERT: a pre-trained biomedical language representation model for biomedical text mining},
  author = {Jinhyuk Lee and Wonjin Yoon and Sungdong Kim and Donghyeon Kim and Sunkyu Kim and Chan Ho So and Jaewoo Kang},
  journal= {arXiv preprint arXiv:1901.08746},
  year   = {2019}
}

备注

Bioinformatics