超大批量随机梯度下降:15分钟内在ImageNet上训练ResNet-50
分布式、并行与集群计算
2017-11-15 v1 计算机视觉与模式识别
机器学习
摘要
我们展示了使用1024块Tesla P100 GPU可在15分钟内完成ResNet-50在ImageNet上90个周期的训练。这是通过使用32k的超大批量大小实现的。为在该大批量大小下保持精度,我们采用了若干技术,如RMSprop预热、无滑动平均的批归一化,以及慢启动学习率调度。本文还描述了用于实现上述性能的系统的硬件与软件的细节。
引用
@article{arxiv.1711.04325,
title = {Extremely Large Minibatch SGD: Training ResNet-50 on ImageNet in 15 Minutes},
author = {Takuya Akiba and Shuji Suzuki and Keisuke Fukuda},
journal= {arXiv preprint arXiv:1711.04325},
year = {2017}
}
备注
NIPS'17 Workshop: Deep Learning at Supercomputer Scale