梯度噪声卷积(GNC):面向分布式大批量SGD的平滑损失函数
机器学习
2019-06-27 v1 机器学习
摘要
大批量随机梯度下降(SGD)因其训练时间效率而被广泛用于分布式深度学习训练,然而,极大的批量SGD会导致泛化性能差并容易收敛到尖锐极小值,这阻碍了朴素的大规模数据并行SGD(DP-SGD)收敛到良好的极小值。为克服此困难,我们提出梯度噪声卷积(GNC),其有效平滑损失函数更尖锐的极小值。对于DP-SGD,GNC利用所谓的梯度噪声——它由随机梯度变异引起,并作为平滑效应卷积到损失函数上。GNC计算可通过在每个并行工作节点上简单计算随机梯度并合并它们来完成,因此极易实现。由于与梯度噪声卷积(其往往沿损失函数更尖锐的方向扩散),GNC能有效平滑尖锐极小值并取得更好的泛化,而各向同性随机噪声则不能。我们通过将GNC与各向同性随机噪声比较,凭经验展示了该效应,并表明其在大规模深度神经网络优化中取得了最先进的泛化性能。
引用
@article{arxiv.1906.10822,
title = {Gradient Noise Convolution (GNC): Smoothing Loss Function for Distributed Large-Batch SGD},
author = {Kosuke Haruki and Taiji Suzuki and Yohei Hamakawa and Takeshi Toda and Ryuji Sakai and Masahiro Ozawa and Mitsuhiro Kimura},
journal= {arXiv preprint arXiv:1906.10822},
year = {2019}
}
备注
19 pages, 11 figures, 7 tables