中文

从近端方法与无尺度性理解 AdamW

机器学习 2022-02-02 v1 最优化与控制

摘要

Adam 因较少的超参数调优与卓越性能已被广泛采用来训练深度神经网络。为改善泛化,Adam 通常与平方 2\ell_2 正则化器(称为 Adam-2\ell_2)联合使用。然而,使用 AdamW 可获得更好的性能,它将正则化器的梯度从 Adam-2\ell_2 的更新规则中解耦。但我们仍缺乏对 AdamW 优势的完整解释。本文中,我们从优化与经验两个角度解决该问题。首先,我们展示如何将 AdamW 重新解释为近端梯度方法的近似,其利用了正则化器的闭式近端映射,而非像 Adam-2\ell_2 中仅利用其梯度信息。接着,我们考虑 AdamW 及其近端对应物所享有的“无尺度性”性质:它们的更新对梯度的分量wise 重标度不变。我们提供了跨广泛深度学习实验的经验证据,显示 AdamW 相对于 Adam-2\ell_2 表现出优势的问题与我们所预期的网络梯度呈现多尺度的程度之间的相关性,从而引出如下假设:AdamW 的优势可能源于无尺度更新。

关键词

引用

@article{arxiv.2202.00089,
  title  = {Understanding AdamW through Proximal Methods and Scale-Freeness},
  author = {Zhenxun Zhuang and Mingrui Liu and Ashok Cutkosky and Francesco Orabona},
  journal= {arXiv preprint arXiv:2202.00089},
  year   = {2022}
}