重新审视分布式同步SGD
分布式、并行与集群计算
2017-03-21 v2 人工智能
机器学习
摘要
在大规模训练数据上深度学习模型的分布式训练通常采用异步随机优化,以最大化更新速率,代价是引入异步带来的额外噪声。相反,同步方法常被认为不实用,因为等待掉队工作节点浪费了空闲时间。我们在本文中重新审视这些传统观念,并审视两种方法的弱点。我们证明第三种方法,即带备份工作节点的同步优化,能够避免异步噪声,同时缓解最严重掉队者的影响。我们的方法经实证验证,显示出更快的收敛速度和更好的测试准确率。
引用
@article{arxiv.1702.05800,
title = {Revisiting Distributed Synchronous SGD},
author = {Xinghao Pan and Jianmin Chen and Rajat Monga and Samy Bengio and Rafal Jozefowicz},
journal= {arXiv preprint arXiv:1702.05800},
year = {2017}
}
备注
This article will be superseded by arXiv:1604.00981