机器学习的增量高斯-牛顿下降
摘要
随机梯度更新因其效率和可扩展性而广泛使用,但其有效步长可能严重依赖于特征缩放和 local model sensitivity。高斯-牛顿方法通过利用曲率信息来解决此类 scale 效应,但在其 standard mini-batch 形式中需要矩阵-向量乘积、线性求解或结构化近似。本文研究标量输出损失逐样本评估的特殊情况。在此 setting 中,generalized Gauss-Newton 矩阵的秩最多为一,其唯一可能的非零曲率方向与随机梯度对齐。因此,阻尼高斯-牛顿方向简化为对样本梯度的闭式标量归一化。 resulting update, Incremental Gauss-Newton Descent (IGND), require 不需要曲率矩阵存储、分解或迭代线性求解。我们推导了该 update,描述了其 behavior,并将其与 normalized gradient descent、adaptive first-order methods、stochastic Polyak 步长以及 mini-batch Gauss-Newton updates 联系起来。在明确的 smoothness、alignment 和 stochastic approximation 假设下,我们证明了 IGND update 的 stationarity 结果。在 supervised learning、受控尺度鲁棒性测试以及 linear-quadratic control case study 中实验表明,IGND 改进了对 sensitivity scaling 的鲁棒性,并且在保持简单增量 update 的同时,可以与 common stochastic optimizers 相竞争或 complementary。
引用
@article{arxiv.2408.05560,
title = {Incremental Gauss-Newton Descent for Machine Learning},
author = {Mikalai Korbit and Mario Zanon},
journal= {arXiv preprint arXiv:2408.05560},
year = {2026}
}