通过梯度对齐实现基于在线学习的自适应学习率
机器学习
2025-06-11 v1 最优化与控制
机器学习
摘要
优化器在大规模深度学习模型上的性能关键取决于学习率的微调,这通常需要对基础学习率、调度器和其他超参数进行广泛的网格搜索。在本文中,我们提出了一个名为 GALA (Gradient Alignment-based Learning rate Adaptation) 的原则性框架,该框架通过跟踪连续梯度之间的对齐并使用局部曲率估计来动态调整学习率。在收敛分析的指导下,我们将选择学习率的问题表述为一维在线学习问题。当与诸如 Follow-the-Regularized-Leader 的在线学习算法结合使用时,我们的方法产生了一种灵活、自适应的学习率调度,在连续梯度对齐时趋于增加,否则趋于减少。我们为配备了 GALA 的归一化 SGD 在平滑非凸设置中建立了数据自适应的收敛率。从经验上看,使用 GALA 增强的常见优化器(如 SGD 和 Adam)在广泛的初始学习率范围内表现出稳健的性能,并且无需调优即具有竞争力。
引用
@article{arxiv.2506.08419,
title = {Online Learning-guided Learning Rate Adaptation via Gradient Alignment},
author = {Ruichen Jiang and Ali Kavis and Aryan Mokhtari},
journal= {arXiv preprint arXiv:2506.08419},
year = {2025}
}
备注
24 pages, 5 figures