用于大批量训练的动态归一化梯度下降与动量法
机器学习
2024-04-16 v2 机器学习
摘要
随机梯度下降(SGD)及其变体一直是机器学习中占主导的优化方法。相较于小批量训练的 SGD,大批量训练的 SGD 能更好地利用当前多核系统(如图形处理单元(GPU))的计算能力,并减少分布式训练中的通信轮数。因此,大批量训练的 SGD 备受关注。然而,已有经验结果表明大批量训练通常导致泛化精度下降。因而,如何保证大批量训练中的泛化能力成为一项挑战。本文提出一种简单而有效的方法,称为动态归一化梯度下降与动量法(SNGM),用于大批量训练。我们证明,在相同的梯度计算次数下,SNGM 可采用比动量 SGD(MSGD,最广泛使用的 SGD 变体之一)更大的批量大小,以收敛至 -驻点。深度学习的经验结果证实,在采用相同大批量时,SNGM 可比 MSGD 及其他最先进的大批量训练方法取得更好的测试精度。
引用
@article{arxiv.2007.13985,
title = {Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training},
author = {Shen-Yi Zhao and Chang-Wei Shi and Yin-Peng Xie and Wu-Jun Li},
journal= {arXiv preprint arXiv:2007.13985},
year = {2024}
}