任意时刻随机梯度下降:倾听所有工作者的时刻
机器学习
2018-10-09 v1 信息论
math.IT
机器学习
摘要
在本文中,我们关注并行化随机梯度下降(SGD)的方法,其中数据被分配至一组工作者,经过若干次更新后,其结果在中央主节点处合并。尽管此类同步SGD方法在理想化计算环境中并行良好,但在实际设置中常无法实现其承诺的计算加速。一个原因是慢速工作者(称为straggler),其可能导致主节点的融合步骤停滞,从而极大拖慢收敛。在许多straggler缓解方法中,这些节点完成的工作虽仅为部分,却被完全丢弃。本文中,我们提出一种并行化同步SGD的方法,其利用所有工作者完成的工作。核心思想是固定每个工作者的计算时间,然后合并所有工作者的不同贡献。我们提供了收敛分析并优化了组合函数。数值结果表明,与现有方法相比有数倍的提升。
引用
@article{arxiv.1810.02976,
title = {Anytime Stochastic Gradient Descent: A Time to Hear from all the Workers},
author = {Nuwan Ferdinand and Stark Draper},
journal= {arXiv preprint arXiv:1810.02976},
year = {2018}
}