紧凑型生物医学 Transformer 的有效性研究
计算与语言
2022-09-08 v1 机器学习
摘要
在生物医学语料上预训练的语言模型(如 BioBERT)近期在下游生物医学任务上展现出有前景的结果。另一方面,许多现有预训练模型由于嵌入维度、隐藏维度和层数等因素而资源密集且计算繁重。自然语言处理(NLP)社区已开发出众多压缩这些模型的策略,利用剪枝、量化和知识蒸馏等技术,从而得到显著更快、更小且随后更易实际使用的模型。同样地,本文我们引入六个轻量模型,即 BioDistilBERT、BioTinyBERT、BioMobileBERT、DistilBioBERT、TinyBioBERT 和 CompactBioBERT,它们或通过从生物医学教师模型进行知识蒸馏,或通过以掩码语言建模(MLM)目标在 Pubmed 数据集上持续学习获得。我们在三个生物医学任务上评估所有模型,并与 BioBERT-v1.1 比较,以创建与其更大对应模型表现相当的的高效轻量模型。所有模型将在我们的 Huggingface 主页 https://huggingface.co/nlpie 公开,用于运行实验的代码见 https://github.com/nlpie-research/Compact-Biomedical-Transformers。
引用
@article{arxiv.2209.03182,
title = {On the Effectiveness of Compact Biomedical Transformers},
author = {Omid Rohanian and Mohammadmahdi Nouriborji and Samaneh Kouchaki and David A. Clifton},
journal= {arXiv preprint arXiv:2209.03182},
year = {2022}
}