面向任意延迟下异步分布式学习的有序局部动量
机器学习
2026-01-21 v1
摘要
动量随机梯度下降(MSGD)是训练深度模型的基础优化器,因为动量在加速收敛和增强泛化方面起着关键作用。同时,异步分布式学习对于训练大规模深度模型至关重要,尤其是当集群中工作节点的计算能力异构时。为了降低通信频率,局部更新在分布式学习中被广泛采用。然而,如何实现带有局部更新的异步分布式MSGD仍未被探索。为了解决这个问题,我们提出了一种新颖的方法,称为有序局部动量(OrLoMo),用于异步分布式学习。在OrLoMo中,每个工作节点在本地运行MSGD。然后,来自每个工作节点的局部动量将由服务器根据其全局迭代索引按顺序聚合。据我们所知,OrLoMo是首个实现带有局部更新的异步分布式MSGD的方法。我们证明了OrLoMo在任意延迟下对于非凸问题的收敛性。实验验证了OrLoMo能够优于其同步对应方法以及其他异步方法。
引用
@article{arxiv.2601.12322,
title = {Ordered Local Momentum for Asynchronous Distributed Learning under Arbitrary Delays},
author = {Chang-Wei Shi and Shi-Shang Wang and Wu-Jun Li},
journal= {arXiv preprint arXiv:2601.12322},
year = {2026}
}