大批量训练无需预热
机器学习
2020-02-06 v1 机器学习
摘要
使用大批量尺寸训练深度神经网络已展现出有前景的结果,并惠及众多实际应用。然而,优化器在训练早期收敛缓慢,且大批量深度学习优化启发式方法与理论依据之间存在鸿沟。本文提出一种用于大批量训练的新型完全分层自适应速率缩放(CLARS)算法。我们还通过引入基于梯度方法的细粒度新分析,分析了所提方法的收敛速率。基于我们的分析,我们弥合了这一鸿沟,并对三种流行的大批量训练技术(包括线性学习率缩放、渐进预热和分层自适应速率缩放)给出了理论洞见。大量实验表明,所提算法大幅优于渐进预热技术,并在 ImageNet 数据集上训练先进深度神经网络(ResNet、DenseNet、MobileNet)时击败了最先进大批量优化器的收敛性。
引用
@article{arxiv.2002.01576,
title = {Large Batch Training Does Not Need Warmup},
author = {Zhouyuan Huo and Bin Gu and Heng Huang},
journal= {arXiv preprint arXiv:2002.01576},
year = {2020}
}