面向 NLP 模型的现代分布式数据并行大规模预训练策略
分布式、并行与集群计算
2022-06-14 v1
摘要
由于具有更大量参数的深度学习模型对计算资源的需求不断增长,分布式深度学习正变得日益流行。与传统训练方法不同,数据并行训练允许多个计算节点同时训练大型深度学习模型,以提升训练效率。在本文中,我们使用 PyTorch 在具有 1 亿参数的语言模型 GPT-2 上,以定性方法提出并比较了六种数据并行训练策略。这些策略分别是单 GPU、单参数服务器、分布式参数服务器、Horovod、带 Apex 混合精度策略的分布式参数服务器,以及带 Apex 混合精度策略的 Horovod。我们还分析了每种策略的定量实验结果。最后,我们得出结论:带 Apex 混合精度策略的分布式参数服务器在单节点训练上性能最佳,而带 Apex 的 Horovod 是在单节点或多节点情况下最稳健的可用方法。
引用
@article{arxiv.2206.06356,
title = {Modern Distributed Data-Parallel Large-Scale Pre-training Strategies For NLP models},
author = {Hao Bai},
journal= {arXiv preprint arXiv:2206.06356},
year = {2022}
}
备注
Accepted by HP3C'22