去中心化随机梯度下降中依赖损失地貌的自调节学习率
机器学习
2021-12-03 v1
摘要
分布式深度学习(DDL)对于大规模深度学习(DL)训练至关重要。同步随机梯度下降(SSGD)是事实上的DDL优化方法。使用足够大的批量大小对于实现DDL运行加速至关重要。在大批量设置下,必须提高学习率以补偿参数更新次数的减少。然而,较大的学习率可能损害SSGD中的收敛性,训练容易发散。近来,去中心化并行SGD(DPSGD)被提出以改善分布式训练速度。在本文中,我们发现DPSGD不仅具有系统级的运行时间优势,而且在大批量设置下相比SSGD具有显著的收敛优势。基于对DPSGD学习动态的详细分析,我们发现DPSGD引入了额外的依赖于地貌的噪声,该噪声自动调节有效学习率以改善收敛。此外,我们从理论上证明该噪声平滑了损失地貌,从而允许更大的学习率。我们在18个最先进的DL模型/任务上进行了广泛研究,并证明在大批量设置下,对于大学习率导致SSGD发散的情况,DPSGD通常能够收敛。我们的发现跨两个不同应用领域一致:计算机视觉(CIFAR10和ImageNet-1K)与自动语音识别(SWB300和SWB2000),以及两类不同的神经网络模型:卷积神经网络和长短期记忆循环神经网络。
引用
@article{arxiv.2112.01433,
title = {Loss Landscape Dependent Self-Adjusting Learning Rates in Decentralized Stochastic Gradient Descent},
author = {Wei Zhang and Mingrui Liu and Yu Feng and Xiaodong Cui and Brian Kingsbury and Yuhai Tu},
journal= {arXiv preprint arXiv:2112.01433},
year = {2021}
}