大规模分布式 SGD:瞬息完成 ImageNet/ResNet-50 训练
机器学习
2019-03-06 v2 计算机视觉与模式识别
摘要
将分布式深度学习扩展到大规模 GPU 集群级别具有挑战性,原因在于大 mini-batch 训练的不稳定性以及梯度同步的开销。我们通过批量大小控制和标签平滑解决了大 mini-batch 训练的不稳定性。我们通过 2D-Torus all-reduce 解决了梯度同步的开销。具体而言,2D-Torus all-reduce 将 GPU 排列在逻辑二维网格中,并在不同方向执行一系列集体操作。这两项技术均使用 Neural Network Libraries (NNL) 实现。我们已在 ABCI 集群上成功在 122 秒内训练 ImageNet/ResNet-50,且精度损失不显著。
引用
@article{arxiv.1811.05233,
title = {Massively Distributed SGD: ImageNet/ResNet-50 Training in a Flash},
author = {Hiroaki Mikami and Hisahiro Suganuma and Pongsakorn U-chupala and Yoshiki Tanaka and Yuichi Kageyama},
journal= {arXiv preprint arXiv:1811.05233},
year = {2019}
}