中文

间隙感知的梯度陈旧性缓解方法

机器学习 2020-02-04 v3 机器学习

摘要

云计算作为深度神经网络分布式训练平台正日益流行。若环境为非专用(云计算中常见),同步随机梯度下降(SSGD)会因掉队者而出现显著减速。异步SGD(ASGD)方法不受这些减速影响,但由于梯度陈旧性会妨碍收敛过程而很少被使用。近期技术在扩展到大量工作节点(计算节点)时缓解梯度陈旧性的效果有限。本文中,我们将间隙(Gap)定义为梯度陈旧性的度量,并提出Gap-Aware(GA),一种新颖的异步分布式方法,该方法按间隙线性惩罚陈旧梯度,即使在扩展到大量工作节点时仍表现良好。我们在CIFAR、ImageNet和WikiText-103数据集上的评估表明,GA在最终测试准确率上优于当前可接受的梯度惩罚方法。我们还给出了GA的收敛速率证明。与先前观点相反,我们表明若应用GA,即使在异步环境中工作节点数量扩展时,动量也会变得有益。

关键词

引用

@article{arxiv.1909.10802,
  title  = {Gap Aware Mitigation of Gradient Staleness},
  author = {Saar Barkai and Ido Hakimi and Assaf Schuster},
  journal= {arXiv preprint arXiv:1909.10802},
  year   = {2020}
}

备注

Published as a conference paper at ICLR 2020