逻辑损失下的大步长梯度下降:损失的非单调性提升优化效率
机器学习
2024-06-11 v2 机器学习
摘要
我们考虑将恒定步长的梯度下降(GD)应用于线性可分数据的逻辑回归,其中恒定步长如此之大以至于损失最初发生振荡。我们证明GD能快速退出这一初始振荡阶段——在步内——并在后续步后达到的收敛速率。我们的结果表明,给定步的预算,GD可以通过激进的步长实现的加速损失,无需使用动量或可变步长调度器。我们的证明技术具有通用性,还能处理一般的分类损失函数(其中加速需要指数尾部)、神经正切核机制下的非线性预测器,以及在适当可分离条件下的大步长在线随机梯度下降(SGD)。
引用
@article{arxiv.2402.15926,
title = {Large Stepsize Gradient Descent for Logistic Loss: Non-Monotonicity of the Loss Improves Optimization Efficiency},
author = {Jingfeng Wu and Peter L. Bartlett and Matus Telgarsky and Bin Yu},
journal= {arXiv preprint arXiv:2402.15926},
year = {2024}
}
备注
COLT 2024 camera ready