中文

QLABGrad:一种无超参数且保证收敛的深度学习方案

机器学习 2024-03-13 v2 最优化与控制

摘要

学习率是深度学习任务的关键超参数,因为它决定了模型参数在学习过程中的更新幅度。然而,学习率的选择通常依赖于经验判断,若不进行大量试错实验,可能无法得到满意的结果。在本研究中,我们提出了一种称为QLABGrad的新型学习率自适应方案。QLABGrad无需任何用户指定的超参数,通过针对给定梯度下降方向优化基于二次损失近似(Quadratic Loss Approximation-Based, QLAB)的函数来自动确定学习率,其中仅需一次额外的正向传播。我们从理论上证明了在损失函数满足光滑Lipschitz条件时QLABGrad的收敛性。在MNIST、CIFAR10和ImageNet数据集上,包括MLP、CNN和ResNet在内的多种架构上的实验结果表明,QLABGrad优于多种竞争性的深度学习方案。

关键词

引用

@article{arxiv.2302.00252,
  title  = {QLABGrad: a Hyperparameter-Free and Convergence-Guaranteed Scheme for Deep Learning},
  author = {Minghan Fu and Fang-Xiang Wu},
  journal= {arXiv preprint arXiv:2302.00252},
  year   = {2024}
}

备注

Accepted by AAAI 2024