缩小规模(并非超大)的预训练语言模型基准测试
计算与语言
2021-05-12 v1 机器学习
机器学习
摘要
基于大型 Transformer 的语言模型在不同的语料库规模、不同的训练步数以及不同的批大小下进行了预训练。与此同时,更基础的组件,例如预训练目标或架构超参数,也被修改。因此,总体而言很难将性能变化归因于特定因素。由于在全规模系统上搜索超参数空间代价过高,我们在共同的预训练语料库上对若干流行基于 Transformer 的架构的缩小版本进行预训练,并在 GLUE 任务的一个子集(Wang et al., 2018)上对它们进行基准测试。具体而言,我们针对不同的形状参数和模型规模系统性地比较了三种预训练目标,同时也改变了预训练步数与批大小。在我们的实验中,MLM + NSP(BERT 风格)始终优于 MLM(RoBERTa 风格)以及标准 LM 目标。此外,我们发现额外的计算主要应分配给增大的模型规模,而训练更多步数是低效的。基于这些观察,作为最后一步,我们尝试使用适用于基于 Transformer 的语言模型的复合缩放(Tan and Le, 2019)来放大若干系统。
引用
@article{arxiv.2105.04876,
title = {Benchmarking down-scaled (not so large) pre-trained language models},
author = {M. Aßenmacher and P. Schulze and C. Heumann},
journal= {arXiv preprint arXiv:2105.04876},
year = {2021}
}
备注
14 pages, 5 figures