并行重启SGD:更快收敛与更少通信——揭秘模型平均在深度学习中生效的原因
最优化与控制
2018-11-19 v3 分布式、并行与集群计算
机器学习
摘要
在深度神经网络的分发式训练中,并行小批量SGD被广泛用于通过多工作节点加速训练过程。它利用多个工作节点并行采样局部随机梯度,在单一服务器中聚合所有梯度得到平均值,并使用该平均梯度通过SGD更新来更新每个工作节点的局部模型。理想情况下,与使用单个工作节点的SGD相比,并行小批量SGD可实现训练时间的线性加速(相对于工作节点数量)。然而,实践中这种线性可扩展性受到随工作节点增多而增长的梯度通信需求的显著限制。模型平均定期平均在并行工作节点上训练得到的各个模型,是自(Zinkevich等人2010)(McDonald、Hall和Mann 2010)以来用于深度神经网络分布式训练的另一种常见做法。与并行小批量SGD相比,模型平均的通信开销显著降低。令人印象深刻的是,大量实验工作已验证,只要仔细控制平均间隔,模型平均仍能实现良好的训练时间加速。然而,这一简单启发式方法为何如此有效在理论上仍是一个谜。本文对模型平均为何能以显著更少的通信开销达到与并行小批量SGD相当的效果,提供了透彻而严谨的理论研究。
引用
@article{arxiv.1807.06629,
title = {Parallel Restarted SGD with Faster Convergence and Less Communication: Demystifying Why Model Averaging Works for Deep Learning},
author = {Hao Yu and Sen Yang and Shenghuo Zhu},
journal= {arXiv preprint arXiv:1807.06629},
year = {2018}
}
备注
No change has been made on the technical proof since V1. V2 changes the title to emphasize its value in deep learning; polishes the writing; and adds numerical simulations. This version further corrects a few typos in V2 posted a few days ago. A short version of this paper is accepted to AAAI 2019