并行与分布式异步自适应随机梯度方法
最优化与控制
2022-04-14 v3 分布式、并行与集群计算
数值分析
数值分析
摘要
随机梯度方法(SGMs)是训练深度学习模型的主流方法。其自适应版本(如 Adam 与 AMSGrad)已在实践中被广泛使用,部分原因是它们在收敛速度上快于非自适应版本,同时带来的额外开销很小。另一方面,异步(async)并行计算相较于其同步(sync)对应方式表现出了显著更高的加速比。异步并行非自适应 SGMs 已从理论与实际性能角度在文献中被充分研究。自适应 SGMs 也可较容易地以异步并行方式实现。然而,据我们所知,尚未建立异步并行自适应 SGMs 的理论结果。分析带异步更新的自适应 SGMs 的困难源于二阶矩项。本文中,我们提出一种基于 AMSGrad 的异步并行自适应 SGM。我们证明,若由异步引起的陈旧度(亦称延迟)有界,则所提方法继承了 AMSGrad 对凸与非凸问题的收敛保证。我们的收敛速率结果表明,若 (其中 为陈旧度, 为迭代次数),则获得近乎线性的并行加速比。所提方法在凸与非凸机器学习问题上均进行了测试,数值结果展示了其相对于同步对应方式与异步并行非自适应 SGM 的明显优势。
引用
@article{arxiv.2002.09095,
title = {Parallel and distributed asynchronous adaptive stochastic gradient methods},
author = {Yangyang Xu and Yibo Xu and Yonggui Yan and Colin Sutcher-Shepard and Leopold Grinberg and Jie Chen},
journal= {arXiv preprint arXiv:2002.09095},
year = {2022}
}