中文

关于去中心化自适应梯度方法的收敛性

机器学习 2021-09-08 v1

摘要

包括 Adam、AdaGrad 及其变体在内的自适应梯度方法在训练深度学习模型(如神经网络)方面非常成功。同时,鉴于对分布式计算的需求,分布式优化算法正迅速成为焦点。随着计算能力的增长以及在移动设备上使用机器学习模型的需求,分布式训练算法的通信代价需要仔细考量。在本文中,我们引入了新颖的收敛去中心化自适应梯度方法,并将自适应梯度方法严格地纳入去中心化训练流程。具体而言,我们提出了一个通用算法框架,可将现有自适应梯度方法转化为其去中心化对应版本。此外,我们深入分析了所提算法框架的收敛行为,并表明若给定自适应梯度方法收敛,在某些特定条件下,其去中心化对应版本亦收敛。我们在原型方法 AMSGrad 上从理论和数值两方面说明了我们通用去中心化框架的优势。

关键词

引用

@article{arxiv.2109.03194,
  title  = {On the Convergence of Decentralized Adaptive Gradient Methods},
  author = {Xiangyi Chen and Belhal Karimi and Weijie Zhao and Ping Li},
  journal= {arXiv preprint arXiv:2109.03194},
  year   = {2021}
}