中文

一种用于训练神经网络的自适应远程随机梯度方法

机器学习 2020-09-08 v8 最优化与控制 机器学习

摘要

我们提出远程随机梯度(RSG)方法,该方法在可配置的远程观测点计算梯度,以针对不同曲率同时改善收敛速率并抑制梯度噪声。RSG 进一步与自适应方法结合构建 ARSG 以实现加速。该方法在计算与内存上高效,且易于实现。我们通过将训练过程建模为动态系统来分析收敛性质,这为在不进行网格搜索的情况下选择可配置观测因子提供了指导。ARSG 在非凸设定下取得 O(1/T)O(1/\sqrt{T}) 收敛速率,在强凸设定下可进一步提升至 O(log(T)/T)O(\log(T)/T)。数值实验表明,相较于 ADAM、NADAM、AMSGRAD 与 RANGER 等流行的自适应方法,ARSG 对测试问题实现了更快收敛与更好的泛化。特别是在 ImageNet 上训练 ResNet-50 时,ARSG 的收敛速度优于 ADAM,同时其泛化能力超越 SGD。

关键词

引用

@article{arxiv.1905.01422,
  title  = {An Adaptive Remote Stochastic Gradient Method for Training Neural Networks},
  author = {Yushu Chen and Hao Jing and Wenlai Zhao and Zhiqiang Liu and Ouyi Li and Liang Qiao and Wei Xue and Guangwen Yang},
  journal= {arXiv preprint arXiv:1905.01422},
  year   = {2020}
}

备注

The generalization is improved by modifying the preconditioner. For training ResNet-50 on ImageNet, ARSG outperforms ADAM in convergence speed and meanwhile it surpasses SGD in generalization. We also present a convergence bound in non-convex settings