基于重量摆动动力学的鲁棒梯度下降与预测外推
机器学习
2025-12-12 v1
摘要
诸如纳斯特罗夫加速梯度(NAG)等加速梯度方法在良好条件下的问题上实现更快的收敛,但在病条件或非凸景观中常因积极的动量累积而发散。我们提出重量摆动合成梯度外推(HB-SGE),一种鲁棒的一阶方法,将重量摆动动力学与预测梯度外推相结合。不同于经典动力方法那些累积历史梯度的做法,HB-SGE使用局部Taylor近似来估计未来梯度方向,提供自适应加速,同时保持稳定性。我们为强凸函数证明了收敛保证,并通过实证演示HB-SGE在NAG和标准动力方法失败的病条件或非凸问题上的稳定性。在条件数的病条件二次问题中,HB-SGE在119次迭代中收敛,而SGD和NAG均发散。在非凸的鲁棒紫松数函数上,HB-SGE在2,718次迭代中收敛,而经典动力方法在10次步骤内即发散。虽然NAG在良好条件下的问题上更快,但HB-SGE在各种景观中为SGD提供了鲁棒的替代方案,实现了加速,仅需的内存开销,同时保持与标准动力方法相同的超参数。
引用
@article{arxiv.2512.10033,
title = {Robust Gradient Descent via Heavy-Ball Momentum with Predictive Extrapolation},
author = {Sarwan Ali},
journal= {arXiv preprint arXiv:2512.10033},
year = {2025}
}