大规模局部SGD的权衡:一项实证研究
机器学习
2021-10-18 v1 计算机视觉与模式识别
摘要
随着数据集与模型日益增大,分布式训练已成为使深度神经网络在合理时间内完成训练的必要组成部分。然而,分布式训练可能产生可观的通信开销,制约其可扩展性。降低该开销的一种策略是在每次同步步骤之间于各工作节点上独立执行多次未同步的SGD步,此技术称为局部SGD(local SGD)。我们在大规模图像分类任务上对局部SGD及相关方法进行了全面的实证研究。我们发现,执行局部SGD需付出代价:更低的通信成本(从而更快的训练)伴随着更低的准确率。该发现与此前小规模实验相反,表明局部SGD在规模扩大时面临挑战。我们进一步表明,引入Wang等人(2020)的慢动量框架可在不增加通信的情况下持续提升准确率,为潜在突破此权衡指明未来方向。
引用
@article{arxiv.2110.08133,
title = {Trade-offs of Local SGD at Scale: An Empirical Study},
author = {Jose Javier Gonzalez Ortiz and Jonathan Frankle and Mike Rabbat and Ari Morcos and Nicolas Ballas},
journal= {arXiv preprint arXiv:2110.08133},
year = {2021}
}