揭开深度神经网络高精度训练中学习率策略的神秘面纱
机器学习
2019-10-29 v2 机器学习
摘要
学习率(LR)是调优深度神经网络(DNNs)有效训练的一个重要超参数。即便是恒定学习率这一基线,为 DNN 训练选取一个好的常数值也非易事。动态学习率涉及在训练过程各阶段对 LR 值进行多步调优,并能提供高准确率和快速收敛。然而,它们更难调优。本文中,我们通过考察 13 个学习率函数及其相关 LR 策略的范围参数、步长参数和值更新参数,对其进行了全面研究。我们提出一组用于评估和选择 LR 策略的度量指标,包括分类置信度、方差、代价和鲁棒性,并在 LRBench(LR 基准测试系统)中实现。LRBench 可协助终端用户和 DNN 开发者为其 DNN 训练选取好的 LR 策略并避免糟糕的 LR 策略。我们在开源深度学习框架 Caffe 上测试了 LRBench,以展示 LR 策略的调优优化。通过大量实验评估,我们尝试通过识别具有有效 LR 值范围和 LR 更新调度步长的好的 LR 策略,来揭开 LR 策略调优的神秘面纱。
引用
@article{arxiv.1908.06477,
title = {Demystifying Learning Rate Policies for High Accuracy Training of Deep Neural Networks},
author = {Yanzhao Wu and Ling Liu and Juhyun Bae and Ka-Ho Chow and Arun Iyengar and Calton Pu and Wenqi Wei and Lei Yu and Qi Zhang},
journal= {arXiv preprint arXiv:1908.06477},
year = {2019}
}
备注
To appear on IEEE Big Data 2019. LRBench (https://github.com/git-disl/LRBench)