中文

面向异步SGD的有序动量

机器学习 2025-01-24 v3 分布式、并行与集群计算

摘要

分布式学习是训练大规模深度模型的必不可少的手段。 异步SGD(ASGD)及其变体在计算节点能力不均的场景中被广泛使用。 动量被认为对深度模型训练中的优化和泛化都有益。然而,既有工作发现, naively 将动量引入ASGD会阻碍收敛。 本文提出一种名为有序动量(OrMo)的新方法,用于ASGD。 在OrMo中,基于迭代索引对梯度进行排序后再引入动量。 我们理论上证明了OrMo在非凸问题下,对常数学习率和延迟自适应学习率均可收敛。 到目前为止,这是首个在不依赖最大延迟的情况下,对ASGD带动量的方法进行收敛分析的工作。 实验结果表明,OrMo的收敛性能优于ASGD及其他带动量的异步方法。

关键词

引用

@article{arxiv.2407.19234,
  title  = {Ordered Momentum for Asynchronous SGD},
  author = {Chang-Wei Shi and Yi-Rui Yang and Wu-Jun Li},
  journal= {arXiv preprint arXiv:2407.19234},
  year   = {2025}
}