中文

使用同步随机梯度下降的分布式深度学习

分布式、并行与集群计算 2016-03-02 v1 机器学习

摘要

我们设计并实现了一种分布式多节点同步SGD算法,无需修改超参数、压缩数据或改变算法行为。我们对扩展性进行了详细分析,并为不同网络确定了最优设计点。我们在数百个节点上展示了CNN的扩展性,并给出了我们认为创纪录的训练吞吐量。512小批量VGG-A CNN训练在128个节点上实现了90倍扩展。256小批量VGG-A和OverFeat-FAST网络分别在64节点集群上实现了53倍和42倍扩展。我们还通过16个节点上7层DNN获得6.5倍的最佳扩展性来展示我们方法的通用性。此后,我们尝试通过在基于以太网的AWS集群上训练来普及深度学习,并在16个节点上展示了约14倍的扩展性。

关键词

引用

@article{arxiv.1602.06709,
  title  = {Distributed Deep Learning Using Synchronous Stochastic Gradient Descent},
  author = {Dipankar Das and Sasikanth Avancha and Dheevatsa Mudigere and Karthikeyan Vaidynathan and Srinivas Sridharan and Dhiraj Kalamkar and Bharat Kaul and Pradeep Dubey},
  journal= {arXiv preprint arXiv:1602.06709},
  year   = {2016}
}