中文

理解权重归一化族与权重衰减的不协调:ε-偏移 L2 正则化器

机器学习 2019-11-15 v1 计算机视觉与模式识别

摘要

权重归一化族具有快速收敛和潜在更优性能的优点,近年来受到越来越多的关注。这些方法使用标准化或归一化将权重 W\boldsymbol{W} 变为 W\boldsymbol{W}',使得 W\boldsymbol{W}' 独立于 W\boldsymbol{W} 的幅值。令人惊讶的是,W\boldsymbol{W} 必须在梯度下降过程中被衰减,否则我们会观察到严重的欠拟合问题,这非常反直觉,因为权重衰减被广泛认为可防止深度网络过拟合。在本文中,我们理论上证明权重衰减项 12λW2\frac{1}{2}\lambda||{\boldsymbol{W}}||^2 仅调节有效学习率以改善目标优化,并且在复合使用权重归一化族时对泛化没有影响。此外,我们还揭示了将权重衰减项引入权重归一化族时的几个关键问题,包括全局最小值的缺失和训练不稳定性。为解决这些问题,我们提出了一种 ε-偏移 L2L_2 正则化器,其将一个正常数 ϵ\epsilon 偏移至 L2L_2 目标。这一简单操作可从理论上保证全局最小值的存在,同时防止网络权重过小从而避免梯度浮点溢出。它显著提高了训练稳定性,并在我们的实践中取得了略好的性能。ε-偏移 L2L_2 正则化器的有效性在 ImageNet、CIFAR-100 和 COCO 数据集上得到了全面验证。我们的代码和预训练模型将在 https://github.com/implus/PytorchInsight 发布。

关键词

引用

@article{arxiv.1911.05920,
  title  = {Understanding the Disharmony between Weight Normalization Family and Weight Decay: $\epsilon-$shifted $L_2$ Regularizer},
  author = {Li Xiang and Chen Shuo and Xia Yan and Yang Jian},
  journal= {arXiv preprint arXiv:1911.05920},
  year   = {2019}
}

备注

12 pages, 9 figures