Grad-GradaGrad?一种非单调自适应随机梯度方法
机器学习
2022-06-15 v1 最优化与控制
机器学习
摘要
经典的 AdaGrad 方法通过将学习率除以梯度平方和的平方根来自适应调整学习率。由于分母中的该求和是递增的,该方法只能随时间减小步长,并且需要仔细调整学习率缩放超参数。为克服这一限制,我们引入了 GradaGrad,一种同族的方法,它基于分母中不同的累积(该累积既可增加也可减少)来自然地增大或缩小学习率。我们证明其服从与 AdaGrad 类似的收敛速率,并通过实验展示了其非单调自适应能力。
引用
@article{arxiv.2206.06900,
title = {Grad-GradaGrad? A Non-Monotone Adaptive Stochastic Gradient Method},
author = {Aaron Defazio and Baoyu Zhou and Lin Xiao},
journal= {arXiv preprint arXiv:2206.06900},
year = {2022}
}