中文

超算规模的图像分类

机器学习 2018-12-04 v2 分布式、并行与集群计算 机器学习

摘要

深度学习计算极度密集,硬件供应商已通过在大型集群中构建更快的加速器作为回应。在 petaFLOPS 规模训练深度学习模型需要克服算法与系统软件两方面的挑战。本文中,我们讨论三项与系统相关的优化:(1)分布式批量归一化以控制每副本批量大小,(2)输入流水线优化以维持模型吞吐,(3)二维环面全归约以加速梯度求和。我们结合这些优化,在 1024 芯片 TPU v3 Pod 上以超过 105 万图像/秒的训练吞吐、且无精度下降,于 2.2 分钟内将 ResNet-50 在 ImageNet 上训练至 76.3% 精度。

关键词

引用

@article{arxiv.1811.06992,
  title  = {Image Classification at Supercomputer Scale},
  author = {Chris Ying and Sameer Kumar and Dehao Chen and Tao Wang and Youlong Cheng},
  journal= {arXiv preprint arXiv:1811.06992},
  year   = {2018}
}

备注

Presented as part of Systems for ML Workshop @ NIPS 2018