中文

MaxVA:通过最大化梯度的观测方差快速自适应步长

机器学习 2021-07-06 v4 机器学习

摘要

RMSProp 和 Adam 等自适应梯度方法使用平方梯度的指数移动估计来计算自适应步长,在含噪目标下比 SGD 取得更好的收敛性。然而,由于不稳定或极端的自适应学习率,Adam 可能出现不良的收敛行为。已有 AMSGrad 和 AdaBound 等方法被提出以在训练后期稳定 Adam 的自适应学习率,但它们在一些实际任务(如训练 Transformer)上并未超越 Adam。在本文中,我们提出一种自适应学习率原则,将 Adam 中平方梯度的运行均值替换为加权均值,权重选取为使各坐标的估计方差最大化。这导致对局部梯度方差的更快适应,从而带来比 Adam 更理想的实证收敛行为。我们证明了所提算法在非凸随机优化问题的温和假设下收敛,并展示了我们的自适应平均方法在机器翻译、自然语言理解及 BERT 大批量预训练上改进的有效性。代码见 https://github.com/zhuchen03/MaxVA。

关键词

引用

@article{arxiv.2006.11918,
  title  = {MaxVA: Fast Adaptation of Step Sizes by Maximizing Observed Variance of Gradients},
  author = {Chen Zhu and Yu Cheng and Zhe Gan and Furong Huang and Jingjing Liu and Tom Goldstein},
  journal= {arXiv preprint arXiv:2006.11918},
  year   = {2021}
}

备注

ECML PKDD 2021