中文

用于大批量训练的动态归一化梯度下降与动量法

机器学习 2024-04-16 v2 机器学习

摘要

随机梯度下降(SGD)及其变体一直是机器学习中占主导的优化方法。相较于小批量训练的 SGD,大批量训练的 SGD 能更好地利用当前多核系统(如图形处理单元(GPU))的计算能力,并减少分布式训练中的通信轮数。因此,大批量训练的 SGD 备受关注。然而,已有经验结果表明大批量训练通常导致泛化精度下降。因而,如何保证大批量训练中的泛化能力成为一项挑战。本文提出一种简单而有效的方法,称为动态归一化梯度下降与动量法(SNGM),用于大批量训练。我们证明,在相同的梯度计算次数下,SNGM 可采用比动量 SGD(MSGD,最广泛使用的 SGD 变体之一)更大的批量大小,以收敛至 ϵ\epsilon-驻点。深度学习的经验结果证实,在采用相同大批量时,SNGM 可比 MSGD 及其他最先进的大批量训练方法取得更好的测试精度。

关键词

引用

@article{arxiv.2007.13985,
  title  = {Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training},
  author = {Shen-Yi Zhao and Chang-Wei Shi and Yin-Peng Xie and Wu-Jun Li},
  journal= {arXiv preprint arXiv:2007.13985},
  year   = {2024}
}