中文

我们能移除自适应梯度方法中的平方根吗?一个二阶视角

机器学习 2024-10-08 v9 最优化与控制

摘要

Adam(W)等自适应梯度优化器是许多深度学习架构(如Transformer)的默认训练算法。它们的对角预条件器基于梯度外积,并通过平方根运算融入参数更新。虽然这些方法常被解释为近似的二阶方法,但平方根代表了一个根本性的差异。在这项工作中,我们研究了当移除平方根,即强化其二阶动机时,自适应方法的行为如何变化。令人惊讶的是,我们发现这种无平方根的自适应方法在卷积架构上缩小了与SGD的泛化差距,同时在Transformer上保持了其基于平方根的对应方法的性能。二阶视角还为开发非对角方法带来了实际好处,这些方法可以通过预条件器不变性的概念纳入任意曲率近似。与Shampoo等基于平方根的方法相比,无平方根的对应方法在使用半精度时工作良好且速度快,因为它们不需要数值不稳定的矩阵根分解和求逆。总的来说,我们的发现为自适应方法的发展提供了新的见解,并提出了关于适应性在其成功中被忽视的作用的重要问题。(实验代码:https://github.com/yorkerlin/remove-the-square-root 优化器代码:https://github.com/f-dangel/sirfshampoo)

关键词

引用

@article{arxiv.2402.03496,
  title  = {Can We Remove the Square-Root in Adaptive Gradient Methods? A Second-Order Perspective},
  author = {Wu Lin and Felix Dangel and Runa Eschenhagen and Juhan Bae and Richard E. Turner and Alireza Makhzani},
  journal= {arXiv preprint arXiv:2402.03496},
  year   = {2024}
}

备注

A long version of the ICML 2024 paper. Updated the caption of Fig 4 to emphasize the importance of the scale invariance of root-free methods