中文

Moshpit SGD:异构不可靠设备上的通信高效去中心化训练

机器学习 2022-01-12 v4 分布式、并行与集群计算 最优化与控制

摘要

在大型数据集上训练深度神经网络常可通过使用多个计算节点来加速。这种方法称为分布式训练,可通过 Ring All-Reduce 等专用消息传递协议利用数百台计算机。然而,大规模运行这些协议需要仅在专用集群中才具备的可靠高速网络。相比之下,许多现实应用(如联邦学习与基于云的分布式训练)运行于网络带宽不稳定的不可靠设备上。因此,这些应用仅限于使用参数服务器或基于 gossip 的平均协议。本工作中,我们提出 Moshpit All-Reduce——一种迭代平均协议,可指数收敛至全局平均值——从而解除了该限制。我们展示了该协议在分布式优化中的效率,并给出强理论保证。实验表明,在 ImageNet 上训练 ResNet-50 相较竞争性基于 gossip 的策略有 1.3 倍加速,在使用可抢占计算节点从头训练 ALBERT-large 时有 1.5 倍加速。

关键词

引用

@article{arxiv.2103.03239,
  title  = {Moshpit SGD: Communication-Efficient Decentralized Training on Heterogeneous Unreliable Devices},
  author = {Max Ryabinin and Eduard Gorbunov and Vsevolod Plokhotnyuk and Gennady Pekhimenko},
  journal= {arXiv preprint arXiv:2103.03239},
  year   = {2022}
}

备注

Accepted to Conference on Neural Information Processing Systems (NeurIPS) 2021. Code: https://github.com/yandex-research/moshpit-sgd