理解权重归一化族与权重衰减的不协调:ε-偏移 L2 正则化器
机器学习
2019-11-15 v1 计算机视觉与模式识别
摘要
权重归一化族具有快速收敛和潜在更优性能的优点,近年来受到越来越多的关注。这些方法使用标准化或归一化将权重 变为 ,使得 独立于 的幅值。令人惊讶的是, 必须在梯度下降过程中被衰减,否则我们会观察到严重的欠拟合问题,这非常反直觉,因为权重衰减被广泛认为可防止深度网络过拟合。在本文中,我们理论上证明权重衰减项 仅调节有效学习率以改善目标优化,并且在复合使用权重归一化族时对泛化没有影响。此外,我们还揭示了将权重衰减项引入权重归一化族时的几个关键问题,包括全局最小值的缺失和训练不稳定性。为解决这些问题,我们提出了一种 ε-偏移 正则化器,其将一个正常数 偏移至 目标。这一简单操作可从理论上保证全局最小值的存在,同时防止网络权重过小从而避免梯度浮点溢出。它显著提高了训练稳定性,并在我们的实践中取得了略好的性能。ε-偏移 正则化器的有效性在 ImageNet、CIFAR-100 和 COCO 数据集上得到了全面验证。我们的代码和预训练模型将在 https://github.com/implus/PytorchInsight 发布。
引用
@article{arxiv.1911.05920,
title = {Understanding the Disharmony between Weight Normalization Family and Weight Decay: $\epsilon-$shifted $L_2$ Regularizer},
author = {Li Xiang and Chen Shuo and Xia Yan and Yang Jian},
journal= {arXiv preprint arXiv:1911.05920},
year = {2019}
}
备注
12 pages, 9 figures