DecentLaM:面向大批量深度训练的去中心化动量 SGD
机器学习
2021-04-27 v1 分布式、并行与集群计算
最优化与控制
摘要
当今深度学习的规模要求高效的分布式训练算法。去中心化动量 SGD(DmSGD)中每个节点仅与邻居平均,比在所有计算节点上进行全局平均的普通并行动量 SGD 通信效率更高。另一方面,大批量训练已被证明对实现运行时间加速至关重要。这促使我们研究 DmSGD 在大批量场景下的表现。本工作中,我们发现动量项会放大 DmSGD 中的不一致偏差。该偏差随批量增大而更显著,从而导致严重的性能退化。我们进而提出 DecentLaM,一种新颖的去中心化大批量动量 SGD,以消除动量引起的偏差。我们建立了非凸与强凸场景下的收敛速率。理论结果证明了 DecentLaM 相对 DmSGD 的优越性,尤其在大批量场景下。在多种计算机视觉任务与模型上的实验结果表明,DecentLaM 兼具高效与高质量的训练。
引用
@article{arxiv.2104.11981,
title = {DecentLaM: Decentralized Momentum SGD for Large-batch Deep Training},
author = {Kun Yuan and Yiming Chen and Xinmeng Huang and Yingya Zhang and Pan Pan and Yinghui Xu and Wotao Yin},
journal= {arXiv preprint arXiv:2104.11981},
year = {2021}
}