动量何时以及为何加速 SGD:一项实证研究
机器学习
2023-06-16 v1 计算机视觉与模式识别
摘要
动量已成为深度学习优化器的关键组件,亟需全面理解其何时以及为何加速随机梯度下降(SGD)。针对“何时”的问题,我们建立了一个有意义的比较框架,在有效学习率 η_ef 下考察带动量 SGD(SGDM)的性能,该概念统一了动量系数 μ 与批量大小 b 对学习率 η 的影响。在 SGDM 与 SGD 具有相同有效学习率与相同批量大小的比较中,我们观察到一致的模式:当 η_ef 较小时,SGDM 与 SGD 的经验训练损失几乎相同;当 η_ef 超过某一阈值后,SGDM 开始优于 SGD。此外,我们观察到 SGDM 相对 SGD 的优势随批量增大而更显著。针对“为何”的问题,我们发现动量加速与突变锐化密切相关,后者用于描述沿更新方向的定向 Hessian 的突然跳跃。具体而言,SGD 与 SGDM 的失配发生在 SGD 经历突变锐化且收敛更慢的同一时刻。动量通过阻止或延迟突变锐化的发生来提升 SGDM 的性能。综上,本研究揭示了动量、学习率与批量大小之间的相互作用,从而增进了我们对动量加速的理解。
引用
@article{arxiv.2306.09000,
title = {When and Why Momentum Accelerates SGD:An Empirical Study},
author = {Jingwen Fu and Bohan Wang and Huishuai Zhang and Zhizheng Zhang and Wei Chen and Nanning Zheng},
journal= {arXiv preprint arXiv:2306.09000},
year = {2023}
}