中文

通过多统计相关方向上梯度的在线线性回归改进 SGD 收敛

机器学习 2023-03-14 v9 机器学习

摘要

深度神经网络通常使用随机梯度下降(SGD)训练,其利用梯度的极粗糙近似来最小化目标函数,仅平均至真实梯度。诸如动量或 ADAM 之类的标准方法仅考虑单一方向,且不尝试建模与极值点的距离——忽略了由计算出的梯度序列提供的宝贵信息,常停滞于某些次优平台。二阶方法本可利用这些错失的机会,然而除承受极大计算代价与数值不稳定性外,许多方法因忽视曲率符号(即 Hessian 的特征值)而吸引至如鞍点之类的次优点。无鞍牛顿法是解决此问题的罕见例子——将鞍点吸引变为排斥,并由此被证明为最终值提供本质改进。然而,它在建模二阶行为时忽视噪声,聚焦于 Krylov 子空间出于数值原因,且需要代价高昂的特征分解。在保持 SFN 优势的同时,提出了利用这些机会的廉价方法。二阶行为是一阶导数的线性依赖——我们可用最小二乘线性回归从噪声梯度序列中最优估计它,此处为在线设定:对旧梯度使用衰减权重。统计相关子空间由近期噪声梯度的 PCA 给出建议——在在线设定中可通过将所考虑方向缓慢旋转向新梯度来实现,逐渐以近期统计相关方向替换旧方向。特征分解也可在线执行:定期执行 QR 方法步以维持对角 Hessian。在二阶建模子空间之外,我们可同时执行梯度下降。

关键词

引用

@article{arxiv.1901.11457,
  title  = {Improving SGD convergence by online linear regression of gradients in multiple statistically relevant directions},
  author = {Jarek Duda},
  journal= {arXiv preprint arXiv:1901.11457},
  year   = {2023}
}

备注

14 pages, 7 figures