Bioformer:一种面向生物医学文本挖掘的高效 Transformer 语言模型
摘要
诸如 Bidirectional Encoder Representations from Transformers (BERT) 之类的预训练语言模型已在自然语言处理 (NLP) 任务中取得最先进的性能。近来,BERT 已被适配到生物医学领域。尽管有效,这些模型拥有数亿参数,在应用于大规模 NLP 应用时计算开销巨大。我们假设原始 BERT 的参数数量可大幅减少且对性能影响甚微。在本研究中,我们提出 Bioformer,一种用于生物医学文本挖掘的紧凑型 BERT 模型。我们预训练了两个 Bioformer 模型(命名为 Bioformer8L 和 Bioformer16L),其模型规模较 BERTBase 缩减了 60%。Bioformer 使用生物医学词表,并基于 PubMed 摘要与 PubMed Central 全文文章从头预训练。我们在四类不同生物医学 NLP 任务的 15 个基准数据集上,对 Bioformer 以及现有生物医学 BERT 模型(包括 BioBERT 和 PubMedBERT)的性能进行了全面评估:命名实体识别、关系抽取、问答与文档分类。结果表明,在参数减少 60% 的情况下,Bioformer16L 的准确率仅比 PubMedBERT 低 0.1%,而 Bioformer8L 低 0.9%。Bioformer16L 与 Bioformer8L 均优于 BioBERTBase-v1.1。此外,Bioformer16L 与 Bioformer8L 的速度是 PubMedBERT/BioBERTBase-v1.1 的 2-3 倍。Bioformer 已成功部署至 PubTator Central,为超过 3500 万篇 PubMed 摘要和 500 万篇 PubMed Central 全文文章提供基因注释。我们通过 https://github.com/WGLab/bioformer 公开提供 Bioformer,包含预训练模型、数据集及下游使用说明。
引用
@article{arxiv.2302.01588,
title = {Bioformer: an efficient transformer language model for biomedical text mining},
author = {Li Fang and Qingyu Chen and Chih-Hsuan Wei and Zhiyong Lu and Kai Wang},
journal= {arXiv preprint arXiv:2302.01588},
year = {2023}
}