中文

权重衰减正则化的三种机制

机器学习 2018-10-30 v1 机器学习

摘要

权重衰减是神经网络工具箱中的标准技巧之一,但其正则化效应的原因却鲜为人知,且近期结果令以 L2L_2 正则化为代表的传统解释受到质疑。对于二者不同的优化器,字面权重衰减已被证明优于 L2L_2 正则化。我们针对三种优化算法(SGD、Adam 和 K-FAC)及多种网络架构对权重衰减进行了实证研究。我们辨识出权重衰减发挥正则化效应的三种不同机制,取决于具体的优化算法与架构:(1) 增大有效学习率,(2) 近似正则化输入-输出雅可比范数,(3) 降低二阶优化的有效阻尼系数。我们的结果为如何改进神经网络的正则化提供了见解。

关键词

引用

@article{arxiv.1810.12281,
  title  = {Three Mechanisms of Weight Decay Regularization},
  author = {Guodong Zhang and Chaoqi Wang and Bowen Xu and Roger Grosse},
  journal= {arXiv preprint arXiv:1810.12281},
  year   = {2018}
}