准一阶方法:梯度下降的 Hessian 感知缩放
最优化与控制
2025-07-15 v3 机器学习
摘要
梯度下降是优化机器学习中大规模问题的主要工具。然而,其性能对学习率的选择高度敏感。梯度下降的一个关键局限在于缺乏自然的缩放机制,这通常需要昂贵的线搜索或启发式调参来确定合适的步长。本文通过引入 Hessian 信息来缩放梯度方向,以解决这一局限。通过考虑函数沿梯度方向的曲率,我们的自适应 Hessian 感知缩放方法即使在非凸情形下也能保证局部单位步长。在满足二阶充分条件的局部极小值附近,我们的方法能以单位步长实现线性收敛。我们证明,在比标准 Lipschitz 梯度光滑性假设显著更弱的条件下,该方法具有全局收敛性。即使 Hessian 信息不精确,局部单位步长保证和全局收敛性质在温和条件下依然成立。最后,我们在一系列凸和非凸机器学习任务上通过实验验证了理论结果,展示了该方法的有效性。
引用
@article{arxiv.2502.03701,
title = {First-ish Order Methods: Hessian-aware Scalings of Gradient Descent},
author = {Oscar Smee and Fred Roosta and Stephen J. Wright},
journal= {arXiv preprint arXiv:2502.03701},
year = {2025}
}