中文

逻辑损失下的大步长梯度下降:损失的非单调性提升优化效率

机器学习 2024-06-11 v2 机器学习

摘要

我们考虑将恒定步长的梯度下降(GD)应用于线性可分数据的逻辑回归,其中恒定步长η\eta如此之大以至于损失最初发生振荡。我们证明GD能快速退出这一初始振荡阶段——在O(η)\mathcal{O}(\eta)步内——并在后续tt步后达到O~(1/(ηt))\tilde{\mathcal{O}}(1 / (\eta t) )的收敛速率。我们的结果表明,给定TT步的预算,GD可以通过激进的步长η:=Θ(T)\eta:= \Theta( T)实现O~(1/T2)\tilde{\mathcal{O}}(1/T^2)的加速损失,无需使用动量或可变步长调度器。我们的证明技术具有通用性,还能处理一般的分类损失函数(其中O~(1/T2)\tilde{\mathcal{O}}(1/T^2)加速需要指数尾部)、神经正切核机制下的非线性预测器,以及在适当可分离条件下的大步长在线随机梯度下降(SGD)。

关键词

引用

@article{arxiv.2402.15926,
  title  = {Large Stepsize Gradient Descent for Logistic Loss: Non-Monotonicity of the Loss Improves Optimization Efficiency},
  author = {Jingfeng Wu and Peter L. Bartlett and Matus Telgarsky and Bin Yu},
  journal= {arXiv preprint arXiv:2402.15926},
  year   = {2024}
}

备注

COLT 2024 camera ready