BioBART:生物医学生成式语言模型的预训练与评估
计算与语言
2022-04-25 v2
摘要
预训练语言模型已成为自然语言处理的重要骨干。近来,领域内预训练已被证明有益于各种特定领域的下游任务。在生物医学领域,自然语言生成(NLG)任务至关重要,但却研究不足。通过受限语言生成或语言提示将自然语言理解(NLU)任务作为 NLG 处理,在通用领域取得了令人满意的性能。我们强调生物医学领域缺乏领域内生成式语言模型以及缺乏系统性的生成式下游基准,这阻碍了研究社区的发展。在这项工作中,我们引入了将 BART 适配到生物医学领域的生成式语言模型 BioBART。我们整理了包括对话、摘要、实体链接和命名实体识别在内的各种生物医学语言生成任务。在 PubMed 摘要上预训练的 BioBART 相比 BART 性能增强,并在若干任务上确立了强基线。此外,我们对 BioBART 的预训练任务进行了消融研究,发现句子置换对下游任务有负面影响。
引用
@article{arxiv.2204.03905,
title = {BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model},
author = {Hongyi Yuan and Zheng Yuan and Ruyi Gan and Jiaxing Zhang and Yutao Xie and Sheng Yu},
journal= {arXiv preprint arXiv:2204.03905},
year = {2022}
}
备注
Accepted by BioNLP 2022, Long Paper