中文

动量何时以及为何加速 SGD:一项实证研究

机器学习 2023-06-16 v1 计算机视觉与模式识别

摘要

动量已成为深度学习优化器的关键组件,亟需全面理解其何时以及为何加速随机梯度下降(SGD)。针对“何时”的问题,我们建立了一个有意义的比较框架,在有效学习率 η_ef 下考察带动量 SGD(SGDM)的性能,该概念统一了动量系数 μ 与批量大小 b 对学习率 η 的影响。在 SGDM 与 SGD 具有相同有效学习率与相同批量大小的比较中,我们观察到一致的模式:当 η_ef 较小时,SGDM 与 SGD 的经验训练损失几乎相同;当 η_ef 超过某一阈值后,SGDM 开始优于 SGD。此外,我们观察到 SGDM 相对 SGD 的优势随批量增大而更显著。针对“为何”的问题,我们发现动量加速与突变锐化密切相关,后者用于描述沿更新方向的定向 Hessian 的突然跳跃。具体而言,SGD 与 SGDM 的失配发生在 SGD 经历突变锐化且收敛更慢的同一时刻。动量通过阻止或延迟突变锐化的发生来提升 SGDM 的性能。综上,本研究揭示了动量、学习率与批量大小之间的相互作用,从而增进了我们对动量加速的理解。

关键词

引用

@article{arxiv.2306.09000,
  title  = {When and Why Momentum Accelerates SGD:An Empirical Study},
  author = {Jingwen Fu and Bohan Wang and Huishuai Zhang and Zhizheng Zhang and Wei Chen and Nanning Zheng},
  journal= {arXiv preprint arXiv:2306.09000},
  year   = {2023}
}