权重衰减正则化的三种机制
机器学习
2018-10-30 v1 机器学习
摘要
权重衰减是神经网络工具箱中的标准技巧之一,但其正则化效应的原因却鲜为人知,且近期结果令以 正则化为代表的传统解释受到质疑。对于二者不同的优化器,字面权重衰减已被证明优于 正则化。我们针对三种优化算法(SGD、Adam 和 K-FAC)及多种网络架构对权重衰减进行了实证研究。我们辨识出权重衰减发挥正则化效应的三种不同机制,取决于具体的优化算法与架构:(1) 增大有效学习率,(2) 近似正则化输入-输出雅可比范数,(3) 降低二阶优化的有效阻尼系数。我们的结果为如何改进神经网络的正则化提供了见解。
引用
@article{arxiv.1810.12281,
title = {Three Mechanisms of Weight Decay Regularization},
author = {Guodong Zhang and Chaoqi Wang and Bowen Xu and Roger Grosse},
journal= {arXiv preprint arXiv:1810.12281},
year = {2018}
}