面向分布式深度学习的随机梯度推送
机器学习
2020-04-23 v3 人工智能
分布式、并行与集群计算
多智能体系统
最优化与控制
机器学习
摘要
分布式数据并行算法旨在通过跨多个节点并行计算大批量梯度更新来加速深度神经网络的训练。使用精确分布式平均(例如通过 AllReduce)来同步节点的方案对掉队者和通信延迟敏感。PushSum gossip 算法对这些问题具有鲁棒性,但仅执行近似分布式平均。本文研究随机梯度推送(Stochastic Gradient Push, SGP),它将 PushSum 与随机梯度更新相结合。我们证明 SGP 以与 SGD 相同的次线性速率收敛到光滑非凸目标的驻点,且所有节点达成一致性。我们在图像分类(ResNet-50、ImageNet)和机器翻译(Transformer、WMT'16 En-De)任务上实证验证了 SGP 的性能。我们的代码将公开可用。
引用
@article{arxiv.1811.10792,
title = {Stochastic Gradient Push for Distributed Deep Learning},
author = {Mahmoud Assran and Nicolas Loizou and Nicolas Ballas and Michael Rabbat},
journal= {arXiv preprint arXiv:1811.10792},
year = {2020}
}
备注
ICML 2019