中文

深度神经网络的自适应权重衰减

机器学习 2019-08-09 v2 神经与进化计算 机器学习

摘要

深度神经网络优化中的正则化通常对避免不良过拟合、提升模型泛化能力至关重要。最流行的正则化算法之一是对模型参数施加 L-2 惩罚导致参数衰减,称为权重衰减,且衰减率在优化过程中一般对所有模型参数恒定。与基于恒定权重衰减率的先前方法不同,我们提出考虑衡量模型当前状态与观测之间差异的残差,以自适应方式确定各参数的权重衰减,称为自适应权重衰减(AdaDecay),其中梯度范数在各层内归一化,且各参数的正则化程度通过其梯度的幅值经 sigmoid 函数按比例确定。我们使用流行基准数据集 MNIST、Fashion-MNIST 和 CIFAR-10,结合从浅到深的常规神经网络模型,与最先进优化算法对比,实证展示了 AdaDecay 的有效性。我们提出算法的定量评估表明,AdaDecay 改善了泛化能力,在所有数据集和模型上取得了更好的准确率。

关键词

引用

@article{arxiv.1907.08931,
  title  = {Adaptive Weight Decay for Deep Neural Networks},
  author = {Kensuke Nakamura and Byung-Woo Hong},
  journal= {arXiv preprint arXiv:1907.08931},
  year   = {2019}
}