AutoDrop:利用自动学习率衰减训练深度学习模型
机器学习
2021-12-14 v2 最优化与控制
摘要
现代深度学习(DL)架构使用 SGD 算法的变体进行训练,该算法采用定义的学习率调度,即在预定义 epoch 处降低学习率,通常是在训练损失预计饱和时。本文中我们开发了一种实现学习率衰减的算法。我们称该方法为 AutoDrop,其动机源于如下观察:对于固定学习率,模型参数的角速度(即收敛方向变化的速率)初始迅速增加,随后趋于软饱和。饱和时优化器减速,因此角速度饱和是降低学习率的一个良好指示器。衰减后,角速度“重置”并遵循前述模式——再次增加直至饱和。我们表明,我们的方法优于 SOTA 训练方法:它加速了 DL 模型的训练并带来更好的泛化。我们还表明我们的方法不需要任何额外的超参数调优。此外,AutoDrop 极其易于实现且计算开销低。最后,我们发展了用于分析算法的理论框架并给出收敛性保证。
引用
@article{arxiv.2111.15317,
title = {AutoDrop: Training Deep Learning Models with Automatic Learning Rate Drop},
author = {Yunfei Teng and Jing Wang and Anna Choromanska},
journal= {arXiv preprint arXiv:2111.15317},
year = {2021}
}
备注
12 figures, 23 pages