中文

探究自适应梯度方法中对均方根的替代方案

机器学习 2021-06-11 v1

摘要

Adam 是一种自适应梯度方法,因其快速可靠的训练性能而被广泛采用。近期的方法并未在 Adam 基础上实现显著改进,往往是因为它们未对其核心特性之一进行创新:以近期梯度的均方根(RMS)进行归一化。然而,正如 Kingma 和 Ba(2015)所指出的,任何数量的 LpL^p 归一化都是可能的,其中 RMS 对应于 p=2p=2 这一特例。在我们的工作中,我们首次从理论和实证上刻画了不同 LpL^p 范数对自适应梯度方法的影响。我们从数学上说明 pp 的选择如何影响步长大小,同时不影响其他理想性质。我们在一系列深度学习基准上评估了采用各种 LpL^p 范数的 Adam,发现 p>2p > 2 始终带来更快的学习速度和更优的最终性能。p=3p=3p=6p=6 的选择在我们的所有实验中也匹配或优于最先进(state-of-the-art)方法。

关键词

引用

@article{arxiv.2106.05449,
  title  = {Investigating Alternatives to the Root Mean Square for Adaptive Gradient Methods},
  author = {Brett Daley and Christopher Amato},
  journal= {arXiv preprint arXiv:2106.05449},
  year   = {2021}
}

备注

12 pages, 6 figures, 3 tables