中文

解耦权重衰减正则化

机器学习 2019-01-08 v3 神经与进化计算 最优化与控制

摘要

对于标准随机梯度下降(按学习率重新缩放时),L2_2 正则化与权重衰减正则化是等价的,但我们证明对于 Adam 等自适应梯度算法而言并非如此。尽管这些算法的常见实现采用了 L2_2 正则化(常称之为“权重衰减”,但由于我们所揭示的不等价性,这可能产生误导),我们提出了一种简单修正,通过将对权重衰减与针对损失函数所采取优化步骤相\emph{解耦},以恢复权重衰减正则化的原始形式。我们提供的经验证据表明,我们所提出的修正(i)使标准 SGD 和 Adam 的权重衰减因子最优选择与学习率设置解耦;(ii)大幅提升了 Adam 的泛化性能,使其在图像分类数据集上能与带动量的 SGD 竞争(此前 Adam 在此类数据集上通常逊于后者)。我们提出的解耦权重衰减已被许多研究者采用,社区已在 TensorFlow 和 PyTorch 中实现;我们实验的完整源代码见 https://github.com/loshchil/AdamW-and-SGDW

关键词

引用

@article{arxiv.1711.05101,
  title  = {Decoupled Weight Decay Regularization},
  author = {Ilya Loshchilov and Frank Hutter},
  journal= {arXiv preprint arXiv:1711.05101},
  year   = {2019}
}

备注

Published as a conference paper at ICLR 2019