重新审视分布式同步SGD
机器学习
2017-03-22 v3 分布式、并行与集群计算
神经与进化计算
摘要
在大规模训练数据上深度学习模型的分布式训练通常采用异步随机优化,以最大化更新速率,代价是引入了来自异步的额外噪声。相反,同步方法常被认为由于等待掉队工作节点造成的空闲时间而不可行。我们在本文中重新审视这些传统观念,并考察两种方法的弱点。我们证明第三种方法,即带备份工作节点的同步优化,能够避免异步噪声,同时缓解最差的掉队者。我们的方法经过实证验证,显示出收敛更快且测试准确率更高。
引用
@article{arxiv.1604.00981,
title = {Revisiting Distributed Synchronous SGD},
author = {Jianmin Chen and Xinghao Pan and Rajat Monga and Samy Bengio and Rafal Jozefowicz},
journal= {arXiv preprint arXiv:1604.00981},
year = {2017}
}
备注
10 pages