中文

论随机拟牛顿方法在深度学习中的效率

机器学习 2023-10-05 v2 最优化与控制

摘要

尽管一阶方法在求解大规模深度学习问题中的优化问题时很流行,但它们存在一些明显缺陷。为缓解此类不足,近期人们关注应用二阶方法,如基于拟牛顿的方法,其仅利用梯度信息构造 Hessian 近似。我们工作的重点是研究用于训练深度神经网络的随机拟牛顿算法的行为。我们分析了两种知名拟牛顿更新:有限内存 Broyden-Fletcher-Goldfarb-Shanno(BFGS)与对称秩一(SR1)。本研究填补了关于两种更新真实性能的空白,并分析了当使用更鲁棒的 BFGS 更新,还是使用更廉价的 SR1 公式(其允许不定 Hessian 近似,从而潜在有助于更好地穿越深度学习中非凸损失函数里存在的病态鞍点)时,是否能获得更高效的训练。我们展示并讨论了广泛实验研究的结果,包括批量归一化与网络架构、有限内存参数、批量大小以及采样策略类型的影响。我们表明随机拟牛顿优化器是高效的,并且在某些情况下能够胜过以最优超参数组合运行的知名一阶 Adam 优化器。

关键词

引用

@article{arxiv.2205.09121,
  title  = {On the efficiency of Stochastic Quasi-Newton Methods for Deep Learning},
  author = {Mahsa Yousefi and Angeles Martinez},
  journal= {arXiv preprint arXiv:2205.09121},
  year   = {2023}
}