中文

基于三角正则化的对称一阶准牛顿方法用于深度学习

最优化与控制 2025-02-19 v1 信息论 机器学习 数值分析 math.IT 数值分析 机器学习

摘要

随机梯度下降及其变种方法(如 Adam 和 AdaGrad)因计算效率高和存储需求低,在深度学习领域广泛应用。然而,这些方法未利用曲率信息,导致迭代结果可能收敛到鞍点或劣局部极小值。另一方面,准牛顿方法通过计算 Hessian 近似矩阵来利用曲率信息,而计算开销与之相当。准牛顿方法复用先前计算的迭代值和梯度,以低秩结构的方式进行更新。目前最广泛使用的准牛顿更新方法是 L-BFGS,其保证 Hessian 近似矩阵为半正定,适用于线搜索情境。然而,深度神经网络的损失函数为非凸函数,其 Hessian 可能为非半正定。本文提出一种有限记忆对称一阶准牛顿方法,允许 Hessian 近似矩阵为不定,从而利用负曲率方向。此外,我们采用修改后的自适应正则化三角规划方法,生成一系列闭式解的三角子问题。我们在自编码器和前馈神经网络模型上测试所提出方法,并将其与最先进的一阶自适应随机方法以及其他准牛顿方法进行比较。

关键词

引用

@article{arxiv.2502.12298,
  title  = {Symmetric Rank-One Quasi-Newton Methods for Deep Learning Using Cubic Regularization},
  author = {Aditya Ranganath and Mukesh Singhal and Roummel Marcia},
  journal= {arXiv preprint arXiv:2502.12298},
  year   = {2025}
}

备注

submitted to TMLR