中文

在超级计算机规模上训练 EfficientNets:一小时达到 83% ImageNet Top-1 准确率

机器学习 2020-11-06 v2 计算机视觉与模式识别 分布式、并行与集群计算

摘要

EfficientNets 是基于高效缩放卷积神经网络的一系列最先进图像分类模型。当前,EfficientNets 的训练可能需要数天时间;例如,在 Cloud TPU v2-8 节点上训练 EfficientNet-B0 模型需 23 小时。本文中,我们探索在具有 2048 核的 TPU-v3 Pods 上扩展 EfficientNets 训练的技术,其动机在于此类规模训练可实现的加速。我们讨论了将训练扩展到 1024 个 TPU-v3 核上批大小 65536 所需的优化,如选择大批量优化器与学习率调度,以及利用分布式评估与批归一化技术。此外,我们给出了在 ImageNet 数据集上训练的 EfficientNet 模型的计时与性能基准,以分析 EfficientNets 在规模下的行为。借助我们的优化,我们能够在 1 小时 4 分钟内将 EfficientNet 在 ImageNet 上训练至 83% 的准确率。

关键词

引用

@article{arxiv.2011.00071,
  title  = {Training EfficientNets at Supercomputer Scale: 83% ImageNet Top-1 Accuracy in One Hour},
  author = {Arissa Wongpanich and Hieu Pham and James Demmel and Mingxing Tan and Quoc Le and Yang You and Sameer Kumar},
  journal= {arXiv preprint arXiv:2011.00071},
  year   = {2020}
}