中文

AdaL:自适应梯度变换有助于收敛与泛化

机器学习 2021-07-06 v1 人工智能

摘要

自适应优化方法已广泛用于深度学习。它们根据过往梯度自适应地缩放学习率,已被证明可有效加速收敛。然而,与SGD相比,它们泛化性能较差。近期研究指出平滑指数梯度噪声导致泛化退化现象。受此启发,我们提出AdaL,对原始梯度进行变换。AdaL通过在早期放大梯度来加速收敛,并通过后期收缩梯度来抑制振荡并稳定优化。此种修正缓解了梯度噪声的平滑性,从而产生更好的泛化性能。我们从理论上证明了AdaL的收敛性,并在若干基准上展示了其有效性。

关键词

引用

@article{arxiv.2107.01525,
  title  = {AdaL: Adaptive Gradient Transformation Contributes to Convergences and Generalizations},
  author = {Hongwei Zhang and Weidong Zou and Hongbo Zhao and Qi Ming and Tijin Yan and Yuanqing Xia and Weipeng Cao},
  journal= {arXiv preprint arXiv:2107.01525},
  year   = {2021}
}