在超级计算机规模上训练 EfficientNets:一小时达到 83% ImageNet Top-1 准确率
机器学习
2020-11-06 v2 计算机视觉与模式识别
分布式、并行与集群计算
摘要
EfficientNets 是基于高效缩放卷积神经网络的一系列最先进图像分类模型。当前,EfficientNets 的训练可能需要数天时间;例如,在 Cloud TPU v2-8 节点上训练 EfficientNet-B0 模型需 23 小时。本文中,我们探索在具有 2048 核的 TPU-v3 Pods 上扩展 EfficientNets 训练的技术,其动机在于此类规模训练可实现的加速。我们讨论了将训练扩展到 1024 个 TPU-v3 核上批大小 65536 所需的优化,如选择大批量优化器与学习率调度,以及利用分布式评估与批归一化技术。此外,我们给出了在 ImageNet 数据集上训练的 EfficientNet 模型的计时与性能基准,以分析 EfficientNets 在规模下的行为。借助我们的优化,我们能够在 1 小时 4 分钟内将 EfficientNet 在 ImageNet 上训练至 83% 的准确率。
引用
@article{arxiv.2011.00071,
title = {Training EfficientNets at Supercomputer Scale: 83% ImageNet Top-1 Accuracy in One Hour},
author = {Arissa Wongpanich and Hieu Pham and James Demmel and Mingxing Tan and Quoc Le and Yang You and Sameer Kumar},
journal= {arXiv preprint arXiv:2011.00071},
year = {2020}
}