中文

自适应梯度方法的动量中心化与异步更新

机器学习 2021-12-03 v3 最优化与控制

摘要

我们提出 ACProp(Asynchronous-centering-Prop),一种结合二阶动量中心化与异步更新的自适应优化器(例如第 t 次更新时,分母使用至第 t-1 步的信息,而分子使用第 t 步的梯度)。ACProp 兼具强理论性质与经验性能。以 Reddi 等人(2018)的例子,我们表明异步优化器(如 AdaShift、ACProp)比同步优化器(如 Adam、RMSProp、AdaBelief)具有更弱的收敛条件;在异步优化器内部,我们表明二阶动量中心化进一步弱化了收敛条件。我们证明 ACProp 在随机非凸情形下具有 O(1/√T) 的收敛速率,匹配 oracle 速率并优于 RMSProp 和 Adam 的 O(logT/√T) 速率。我们在广泛的经验研究中验证 ACProp:在 CNN 图像分类中 ACProp 优于 SGD 及其他自适应优化器,并在各类 GAN 模型、强化学习和 transformer 的训练中优于调优良好的自适应优化器。总之,ACProp 具有良好的理论性质,包括弱收敛条件和最优收敛速率,以及强大的经验性能,包括如 SGD 般的良好泛化能力和如 Adam 般的训练稳定性。我们在 https://github.com/juntang-zhuang/ACProp-Optimizer 提供实现。

关键词

引用

@article{arxiv.2110.05454,
  title  = {Momentum Centering and Asynchronous Update for Adaptive Gradient Methods},
  author = {Juntang Zhuang and Yifan Ding and Tommy Tang and Nicha Dvornek and Sekhar Tatikonda and James S. Duncan},
  journal= {arXiv preprint arXiv:2110.05454},
  year   = {2021}
}