面向生物医学问答的预训练语言模型
计算与语言
2019-09-19 v1
摘要
问答系统近期的成功很大程度上归功于预训练语言模型。然而,由于语言模型多在如维基百科等通用领域语料上预训练,它们常难以理解生物医学问题。本文中,我们考察了预训练生物医学语言模型 BioBERT 在回答包括事实型、列举型和是否型问题的生物医学问题上的表现。BioBERT 在各种问题类型上采用几乎相同的结构,并在第 7 届 BioASQ 挑战赛(任务 7b,阶段 B)中取得最佳性能。在 SQuAD 或 SQuAD 2.0 上预训练的 BioBERT 轻松超越了此前的最先进模型。当 BioBERT 对问题、段落和答案采用恰当的预/后处理策略时,获得了最佳性能。
引用
@article{arxiv.1909.08229,
title = {Pre-trained Language Model for Biomedical Question Answering},
author = {Wonjin Yoon and Jinhyuk Lee and Donghyeon Kim and Minbyul Jeong and Jaewoo Kang},
journal= {arXiv preprint arXiv:1909.08229},
year = {2019}
}
备注
This paper is accepted for an oral presentation in BioASQ Workshop @ ECML PKDD 2019