面向异步SGD的有序动量
机器学习
2025-01-24 v3 分布式、并行与集群计算
摘要
分布式学习是训练大规模深度模型的必不可少的手段。 异步SGD(ASGD)及其变体在计算节点能力不均的场景中被广泛使用。 动量被认为对深度模型训练中的优化和泛化都有益。然而,既有工作发现, naively 将动量引入ASGD会阻碍收敛。 本文提出一种名为有序动量(OrMo)的新方法,用于ASGD。 在OrMo中,基于迭代索引对梯度进行排序后再引入动量。 我们理论上证明了OrMo在非凸问题下,对常数学习率和延迟自适应学习率均可收敛。 到目前为止,这是首个在不依赖最大延迟的情况下,对ASGD带动量的方法进行收敛分析的工作。 实验结果表明,OrMo的收敛性能优于ASGD及其他带动量的异步方法。
引用
@article{arxiv.2407.19234,
title = {Ordered Momentum for Asynchronous SGD},
author = {Chang-Wei Shi and Yi-Rui Yang and Wu-Jun Li},
journal= {arXiv preprint arXiv:2407.19234},
year = {2025}
}