QLABGrad:一种无超参数且保证收敛的深度学习方案
机器学习
2024-03-13 v2 最优化与控制
摘要
学习率是深度学习任务的关键超参数,因为它决定了模型参数在学习过程中的更新幅度。然而,学习率的选择通常依赖于经验判断,若不进行大量试错实验,可能无法得到满意的结果。在本研究中,我们提出了一种称为QLABGrad的新型学习率自适应方案。QLABGrad无需任何用户指定的超参数,通过针对给定梯度下降方向优化基于二次损失近似(Quadratic Loss Approximation-Based, QLAB)的函数来自动确定学习率,其中仅需一次额外的正向传播。我们从理论上证明了在损失函数满足光滑Lipschitz条件时QLABGrad的收敛性。在MNIST、CIFAR10和ImageNet数据集上,包括MLP、CNN和ResNet在内的多种架构上的实验结果表明,QLABGrad优于多种竞争性的深度学习方案。
引用
@article{arxiv.2302.00252,
title = {QLABGrad: a Hyperparameter-Free and Convergence-Guaranteed Scheme for Deep Learning},
author = {Minghan Fu and Fang-Xiang Wu},
journal= {arXiv preprint arXiv:2302.00252},
year = {2024}
}
备注
Accepted by AAAI 2024