中文

面向异步分布式训练的梯度稀疏化方法

分布式、并行与集群计算 2019-10-25 v1 机器学习

摘要

现代大规模机器学习应用需要将随机优化算法实现于分布式计算架构上。一个关键瓶颈是不同节点间交换信息(如随机梯度)的通信开销。近来,梯度稀疏化技术被提出以降低通信成本从而缓解网络开销。然而,大多数梯度稀疏化技术仅考虑同步并行,无法应用于异步场景,例如移动设备上联邦学习的异步分布式训练。本文提出一种适用于异步分布式训练的双路梯度稀疏化方法(DGS)。我们让工作节点从服务器下载模型差异而非全局模型,且模型差异信息同样被稀疏化,从而通过稀疏化服务器与工作节点间的双路通信来降低信息交换开销。为在双路稀疏化下保持精度,我们设计了稀疏化感知动量(SAMomentum),将稀疏化转化为各参数间的自适应批大小。我们在32个工作节点的集群上开展实验,结果表明在以相同压缩比和更低通信成本下,我们的方法可实现更好的可扩展性与泛化能力。

关键词

引用

@article{arxiv.1910.10929,
  title  = {Gradient Sparification for Asynchronous Distributed Training},
  author = {Zijie Yan},
  journal= {arXiv preprint arXiv:1910.10929},
  year   = {2019}
}

备注

8 pages