超算规模的图像分类
机器学习
2018-12-04 v2 分布式、并行与集群计算
机器学习
摘要
深度学习计算极度密集,硬件供应商已通过在大型集群中构建更快的加速器作为回应。在 petaFLOPS 规模训练深度学习模型需要克服算法与系统软件两方面的挑战。本文中,我们讨论三项与系统相关的优化:(1)分布式批量归一化以控制每副本批量大小,(2)输入流水线优化以维持模型吞吐,(3)二维环面全归约以加速梯度求和。我们结合这些优化,在 1024 芯片 TPU v3 Pod 上以超过 105 万图像/秒的训练吞吐、且无精度下降,于 2.2 分钟内将 ResNet-50 在 ImageNet 上训练至 76.3% 精度。
引用
@article{arxiv.1811.06992,
title = {Image Classification at Supercomputer Scale},
author = {Chris Ying and Sameer Kumar and Dehao Chen and Tao Wang and Youlong Cheng},
journal= {arXiv preprint arXiv:1811.06992},
year = {2018}
}
备注
Presented as part of Systems for ML Workshop @ NIPS 2018