一种具有稀疏全局规约的分布式分层SGD算法
机器学习
2019-09-10 v2 分布式、并行与集群计算
最优化与控制
机器学习
摘要
在分布式平台上训练大规模机器学习应用时的通信削减仍是一项重大挑战。为解决此问题,我们通过引入局部规约,提出了一种具有不频繁全局规约的分布式分层平均随机梯度下降(Hier-AVG)算法。作为并行SGD的一种通用类型,Hier-AVG可通过调整其参数复现若干流行的同步并行SGD变体。我们证明具有不频繁全局规约的Hier-AVG仍能在非凸优化问题上达到标准收敛速率。此外,我们表明更频繁的局部平均且参与方更多可带来更快的训练收敛。通过将Hier-AVG与另一种流行的分布式训练算法K-AVG比较,我们证明通过部署局部平均并减少全局平均次数,Hier-AVG仍能取得可比的训练速度,同时频繁获得更好的测试精度。这表明当学习器数量较大时,局部平均可作为有效降低通信开销的一种替代补救方案。我们给出了Hier-AVG在CIFAR-10和IMAGENET-1K上使用若干最先进深度神经网络的实验结果,以验证我们的分析并展示其优越性。
引用
@article{arxiv.1903.05133,
title = {A Distributed Hierarchical SGD Algorithm with Sparse Global Reduction},
author = {Fan Zhou and Guojing Cong},
journal= {arXiv preprint arXiv:1903.05133},
year = {2019}
}
备注
38 pages