LRTuner:一种面向深度神经网络的学习率调谐器
机器学习
2021-06-01 v1
摘要
训练深度神经网络一个非常重要的超参数是优化器的学习率调度。学习率调度的选择决定了接近极小值所需的计算代价、实际接近极小值的程度,以及最重要的,所达到的局部极小值类型(宽/窄)。所达到的极小值类型对网络的泛化精度有显著影响。当前系统采用手工调谐的学习率调度,针对每个网络和数据集均需费力调整。鉴于调度的状态空间巨大,找到满意的学习率调度可能非常耗时。本文提出 LRTuner,一种在训练过程中调谐学习率的方法。我们的方法适用于任意优化器,并在带动量的 SGD 和 Adam 优化器上展示了结果。我们在多个数据集、模型及不同优化器上对 LRTuner 进行了广泛评估。与给定数据集和模型的标准学习率调度相比,包括 ImageNet 上的 Resnet-50、Cifar-10 上的 Resnet-18 以及 BERT 上的 SQuAD 微调,我们均表现出优势。例如在 ImageNet 与 Resnet-50 上,LRTuner 相比手工调谐的基线调度在测试精度上最高提升 0.2% 绝对值。此外,LRTuner 能以少 29% 的优化步数达到与基线调度相同的精度。
引用
@article{arxiv.2105.14526,
title = {LRTuner: A Learning Rate Tuner for Deep Neural Networks},
author = {Nikhil Iyer and V Thejas and Nipun Kwatra and Ramachandran Ramjee and Muthian Sivathanu},
journal= {arXiv preprint arXiv:2105.14526},
year = {2021}
}
备注
17 pages