中文

指数图被证明对去中心化深度训练高效

机器学习 2021-10-27 v1 最优化与控制

摘要

去中心化 SGD 是一种新兴的深度学习训练方法,以其每次迭代通信量少得多(因而更快)而著称,它将并行 SGD 中的平均步骤放宽为非精确平均。然而,平均越不精确,训练所需的总迭代次数就越多。因此,使去中心化 SGD 高效的关键在于用极少的通信实现近乎精确的平均。这需要对通信拓扑的巧妙选择,而这是去中心化优化中一个研究不足的话题。在本文中,我们研究所谓的指数图,其中每个节点连接到 O(log(n))O(\log(n)) 个邻居,且 nn 为节点总数。本工作证明此类图可同时带来快速通信与有效平均。我们还发现,一串 log(n)\log(n) 个单对等指数图(其中每个节点每次迭代仅与一个邻居通信)可共同实现精确平均。这一有利特性使得单对等指数图能像其静态对应图一样有效地平均,但通信更高效。我们将这些指数图应用于去中心化(动量)SGD,从而在常用拓扑中获得了每次迭代通信与迭代复杂度之间的最优平衡。在各种任务和模型上的实验结果表明,基于指数图的去中心化(动量)SGD 有望实现快速且高质量的训练。我们的代码通过 BlueFog 实现,可在 https://github.com/Bluefog-Lib/NeurIPS2021-Exponential-Graph 获取。

关键词

引用

@article{arxiv.2110.13363,
  title  = {Exponential Graph is Provably Efficient for Decentralized Deep Training},
  author = {Bicheng Ying and Kun Yuan and Yiming Chen and Hanbin Hu and Pan Pan and Wotao Yin},
  journal= {arXiv preprint arXiv:2110.13363},
  year   = {2021}
}