中文

具有混合精度、可高度扩展的深度学习训练系统:四分钟训练 ImageNet

机器学习 2018-07-31 v1 分布式、并行与集群计算 机器学习

摘要

具有数据并行性的同步随机梯度下降(SGD)优化器被广泛用于训练大规模深度神经网络。尽管使用更大的 mini-batch 尺寸可通过降低通信-计算比来改善系统可扩展性,但可能损害模型的泛化能力。为此,我们为稠密 GPU 集群构建了一个高度可扩展的深度学习训练系统,主要有三点贡献:(1)我们提出了一种混合精度训练方法,在不损失精度的情况下显著提升了单 GPU 的训练吞吐量。(2)我们提出了一种针对极大 mini-batch 尺寸(高达 64k)的优化方法,可在 ImageNet 数据集上训练 CNN 模型而不损失精度。(3)我们提出了高度优化的 all-reduce 算法,在含 1024 块 Tesla P40 GPU 的集群上相比基于 NCCL 的训练,在 AlexNet 和 ResNet-50 上分别实现高达 3 倍和 11 倍的加速。在训练 90 轮的 ResNet-50 时,最先进的基于 GPU 的系统使用 1024 块 Tesla P100 GPU 耗时 15 分钟并取得 74.9% 的 top-1 测试精度,另一个基于 KNL 的系统使用 2048 个 Intel KNL 耗时 20 分钟并取得 75.4% 精度。我们的训练系统使用 2048 块 Tesla P40 GPU 仅在 6.6 分钟内即可达到 75.8% 的 top-1 测试精度。在训练 95 轮的 AlexNet 时,我们的系统可在 4 分钟内达到 58.7% 的 top-1 测试精度,同样优于所有其他现有系统。

关键词

引用

@article{arxiv.1807.11205,
  title  = {Highly Scalable Deep Learning Training System with Mixed-Precision: Training ImageNet in Four Minutes},
  author = {Xianyan Jia and Shutao Song and Wei He and Yangzihao Wang and Haidong Rong and Feihu Zhou and Liqiang Xie and Zhenyu Guo and Yuanzhou Yang and Liwei Yu and Tiegang Chen and Guangxiao Hu and Shaohuai Shi and Xiaowen Chu},
  journal= {arXiv preprint arXiv:1807.11205},
  year   = {2018}
}

备注

arXiv admin note: text overlap with arXiv:1803.03383 by other authors