MoMo:用于自适应学习率的动量模型
机器学习
2024-06-06 v3 最优化与控制
摘要
在新任务上训练现代机器学习架构需要大量的学习率调优,这带来了高昂的计算成本。本文我们开发了新型的 Polyak 型自适应学习率,可置于任意动量方法之上,且只需较少调优即可表现良好。我们首先开发了 MoMo,一种基于动量模型(Momentum Model)的 SGD-M(带动量的随机梯度下降)自适应学习率。MoMo 利用每次迭代采样的损失和梯度的动量估计来构建损失函数模型。我们的模型通过截断利用了损失函数的任何已知下界,例如大多数损失的下界为零。然后在每次迭代中近似最小化该模型以计算下一步。我们展示了 MoMo 如何与任何基于动量的方法结合使用,并以此开发了 MoMo-Adam,即采用我们新基于模型的自适应学习率的 Adam。我们证明,对于具有插值性质的凸问题,MoMo 达到 的收敛速率,且除最优值外无需知道任何问题相关量。此外,对于下界未知的损失,我们开发了下界的即时估计,并纳入我们的模型中。我们表明,在 MNIST、CIFAR 和 Imagenet 上训练图像分类器、在 Criteo 上训练推荐系统、在 IWSLT14 翻译任务上训练 transformer 模型以及训练扩散模型时,MoMo 和 MoMo-Adam 在超参数调优的鲁棒性方面优于 SGD-M 和 Adam。
引用
@article{arxiv.2305.07583,
title = {MoMo: Momentum Models for Adaptive Learning Rates},
author = {Fabian Schaipp and Ruben Ohana and Michael Eickenberg and Aaron Defazio and Robert M. Gower},
journal= {arXiv preprint arXiv:2305.07583},
year = {2024}
}