Small-Bench NLP:面向单 GPU 训练小模型的自然语言处理基准
机器学习
2021-09-24 v2 计算与语言
摘要
自然语言处理领域近期的进展为我们带来了若干可在特定任务上微调的 State-of-the-Art (SOTA) 预训练模型。这些在数周时间内于大量 GPU/TPU 上训练、拥有数十亿参数的大型模型在基准排行榜上处于领先地位。本文中,我们讨论了针对在单 GPU 上训练的成本与时间高效的小模型建立基准的必要性。这将使资源受限的研究人员能够尝试关于分词、预训练任务、架构、微调方法等方面的新颖且创新的想法。我们建立了 Small-Bench NLP,一个针对单 GPU 上训练的小型高效神经语言模型的基准。Small-Bench NLP 基准包含公开可用 GLUE 数据集上的八个 NLP 任务以及一个用于追踪社区进展的排行榜。我们的 ELECTRA-DeBERTa(1500 万参数)小模型架构取得了 81.53 的平均分,可与 BERT-Base 的 82.20(1.1 亿参数)相媲美。我们的模型、代码与排行榜可在 https://github.com/smallbenchnlp 获取。
引用
@article{arxiv.2109.10847,
title = {Small-Bench NLP: Benchmark for small single GPU trained models in Natural Language Processing},
author = {Kamal Raj Kanakarajan and Bhuvana Kundumani and Malaikannan Sankarasubbu},
journal= {arXiv preprint arXiv:2109.10847},
year = {2021}
}