中文

理解解耦与早期权重衰减

机器学习 2020-12-29 v1 机器学习

摘要

权重衰减 (WD) 是深度学习中的传统正则化技术,但尽管其无处不在,其行为仍是活跃的研究领域。Golatkar 等人最近表明,在计算机视觉中 WD 仅在训练开始时起作用,这颠覆了传统认知。Loshchilov 等人表明,对于自适应优化器,手动衰减权重优于向损失添加 l2l_2 惩罚。该技术日益流行,被称为解耦 WD。本文旨在研究这两个近期经验观测。我们证明,通过仅在开始时应用 WD,网络范数在整个训练过程中保持较小。这具有正则化效应,因为有效梯度更新变得更大。然而,传统的泛化度量未能捕捉 WD 的这一效应,我们展示了简单的尺度不变度量如何做到。我们还展示了网络权重的增长深受数据集及其泛化性质的影响。对于解耦 WD,我们在 NLP 和 RL 中进行了自适应优化器占主导的实验。我们证明解耦 WD 所缓解的主要问题是目标函数与 l2l_2 惩罚的梯度在 Adam(存储一阶矩估计)的缓冲区中的混合。适应性本身并非问题,解耦 WD 确保来自 l2l_2 项的梯度不会“淹没”真实目标,从而便于超参数调优。

关键词

引用

@article{arxiv.2012.13841,
  title  = {Understanding Decoupled and Early Weight Decay},
  author = {Johan Bjorck and Kilian Weinberger and Carla Gomes},
  journal= {arXiv preprint arXiv:2012.13841},
  year   = {2020}
}