中文

多节点 BERT 预训练:一种高性价比方法

机器学习 2020-08-04 v1 计算与语言 机器学习

摘要

近来,基于大规模 Transformer 的语言模型如 BERT、GPT-2 和 XLNet 为许多自然语言处理(NLP)任务的最先进结果带来了令人振奋的飞跃。这些近期模型的一个共同趋势是模型复杂度的显著增加,这引入了更多的权重与计算量。此外,随着大规模无监督数据集的出现,由于单个训练周期内数据样本量的增加,训练时间进一步延长。因此,为在合理时间内训练这些模型,机器学习(ML)程序员常需要先进的硬件配置,如高端 GPU 支持的 NVIDIA DGX 工作站或 Google 的 TPU Pods 等专用加速器。我们的工作解决了这一限制,并通过细致算法与软件优化表明,BERT 预训练模型可在由广泛可用的 GPU 组成的学术规模集群上于两周内完成训练。在本文中,我们呈现了这些关于如何提升单设备训练吞吐率、将训练负载分布于多节点与多 GPU 上、以及克服由网络大数据交换引入的通信瓶颈的优化。我们展示能够在学术环境下以合理时间预算(12 天)完成 BERT 预训练,但相比此前基于 NVIDIA DGX 机器或 Google TPU Pods 的工业界设置,硬件资源需求远为廉价且不激进。

关键词

引用

@article{arxiv.2008.00177,
  title  = {Multi-node Bert-pretraining: Cost-efficient Approach},
  author = {Jiahuang Lin and Xin Li and Gennady Pekhimenko},
  journal= {arXiv preprint arXiv:2008.00177},
  year   = {2020}
}