用于深度网络训练的具有层自适应矩的随机梯度方法
机器学习
2020-02-10 v3 机器学习
摘要
我们提出 NovoGrad,一种具有层-wise 梯度归一化和解耦权重衰减的自适应随机梯度下降方法。在针对图像分类、语音识别、机器翻译和语言建模的神经网络实验中,其表现与调优良好的带动量 SGD 以及 Adam 或 AdamW 相当或更好。此外,NovoGrad (1) 对学习率和权重初始化的选择具有鲁棒性,(2) 在大数据批设置下表现良好,且 (3) 内存占用比 Adam 小两倍。
引用
@article{arxiv.1905.11286,
title = {Stochastic Gradient Methods with Layer-wise Adaptive Moments for Training of Deep Networks},
author = {Boris Ginsburg and Patrice Castonguay and Oleksii Hrinchuk and Oleksii Kuchaiev and Vitaly Lavrukhin and Ryan Leary and Jason Li and Huyen Nguyen and Yang Zhang and Jonathan M. Cohen},
journal= {arXiv preprint arXiv:1905.11286},
year = {2020}
}
备注
Preprint, under review