以领域特定 ALBERT 对生物医学自然语言处理任务进行基准测试
计算与语言
2021-07-12 v1
摘要
生物医学文本数据的可得性与自然语言处理(NLP)的进步使生物医学 NLP 的新应用成为可能。使用领域特定语料库训练或微调的语言模型可优于通用模型,但迄今生物医学 NLP 的工作在语料库与任务方面均有限。我们提出 BioALBERT,即 A Lite Bidirectional Encoder Representations from Transformers (ALBERT) 的领域特定适配版,在生物医学(PubMed 与 PubMed Central)与临床(MIMIC-III)语料库上训练,并针对 20 个基准数据集上的 6 种不同任务微调。实验表明 BioALBERT 在命名实体识别(+11.09% BLURB 分数提升)、关系抽取(+0.80% BLURB 分数)、句子相似度(+1.05% BLURB 分数)、文档分类(+0.62% F1-score)与问答(+2.83% BLURB 分数)上均优于当前最优。其在 20 个基准数据集中的 17 个上代表新的最优结果。通过公开 BioALBERT 模型与数据,我们旨在帮助生物医学 NLP 社区避免训练的计算成本,并为未来广泛生物医学 NLP 任务的工作建立一组新基线。
引用
@article{arxiv.2107.04374,
title = {Benchmarking for Biomedical Natural Language Processing Tasks with a Domain Specific ALBERT},
author = {Usman Naseem and Adam G. Dunn and Matloob Khushi and Jinman Kim},
journal= {arXiv preprint arXiv:2107.04374},
year = {2021}
}