中文

大规模分布式 SGD:瞬息完成 ImageNet/ResNet-50 训练

机器学习 2019-03-06 v2 计算机视觉与模式识别

摘要

将分布式深度学习扩展到大规模 GPU 集群级别具有挑战性,原因在于大 mini-batch 训练的不稳定性以及梯度同步的开销。我们通过批量大小控制和标签平滑解决了大 mini-batch 训练的不稳定性。我们通过 2D-Torus all-reduce 解决了梯度同步的开销。具体而言,2D-Torus all-reduce 将 GPU 排列在逻辑二维网格中,并在不同方向执行一系列集体操作。这两项技术均使用 Neural Network Libraries (NNL) 实现。我们已在 ABCI 集群上成功在 122 秒内训练 ImageNet/ResNet-50,且精度损失不显著。

关键词

引用

@article{arxiv.1811.05233,
  title  = {Massively Distributed SGD: ImageNet/ResNet-50 Training in a Flash},
  author = {Hiroaki Mikami and Hisahiro Suganuma and Pongsakorn U-chupala and Yoshiki Tanaka and Yuichi Kageyama},
  journal= {arXiv preprint arXiv:1811.05233},
  year   = {2019}
}