MaxVA:通过最大化梯度的观测方差快速自适应步长
机器学习
2021-07-06 v4 机器学习
摘要
RMSProp 和 Adam 等自适应梯度方法使用平方梯度的指数移动估计来计算自适应步长,在含噪目标下比 SGD 取得更好的收敛性。然而,由于不稳定或极端的自适应学习率,Adam 可能出现不良的收敛行为。已有 AMSGrad 和 AdaBound 等方法被提出以在训练后期稳定 Adam 的自适应学习率,但它们在一些实际任务(如训练 Transformer)上并未超越 Adam。在本文中,我们提出一种自适应学习率原则,将 Adam 中平方梯度的运行均值替换为加权均值,权重选取为使各坐标的估计方差最大化。这导致对局部梯度方差的更快适应,从而带来比 Adam 更理想的实证收敛行为。我们证明了所提算法在非凸随机优化问题的温和假设下收敛,并展示了我们的自适应平均方法在机器翻译、自然语言理解及 BERT 大批量预训练上改进的有效性。代码见 https://github.com/zhuchen03/MaxVA。
引用
@article{arxiv.2006.11918,
title = {MaxVA: Fast Adaptation of Step Sizes by Maximizing Observed Variance of Gradients},
author = {Chen Zhu and Yu Cheng and Zhe Gan and Furong Huang and Jingjing Liu and Tom Goldstein},
journal= {arXiv preprint arXiv:2006.11918},
year = {2021}
}
备注
ECML PKDD 2021