一种用于训练神经网络的自适应远程随机梯度方法
机器学习
2020-09-08 v8 最优化与控制
机器学习
摘要
我们提出远程随机梯度(RSG)方法,该方法在可配置的远程观测点计算梯度,以针对不同曲率同时改善收敛速率并抑制梯度噪声。RSG 进一步与自适应方法结合构建 ARSG 以实现加速。该方法在计算与内存上高效,且易于实现。我们通过将训练过程建模为动态系统来分析收敛性质,这为在不进行网格搜索的情况下选择可配置观测因子提供了指导。ARSG 在非凸设定下取得 收敛速率,在强凸设定下可进一步提升至 。数值实验表明,相较于 ADAM、NADAM、AMSGRAD 与 RANGER 等流行的自适应方法,ARSG 对测试问题实现了更快收敛与更好的泛化。特别是在 ImageNet 上训练 ResNet-50 时,ARSG 的收敛速度优于 ADAM,同时其泛化能力超越 SGD。
引用
@article{arxiv.1905.01422,
title = {An Adaptive Remote Stochastic Gradient Method for Training Neural Networks},
author = {Yushu Chen and Hao Jing and Wenlai Zhao and Zhiqiang Liu and Ouyi Li and Liang Qiao and Wei Xue and Guangwen Yang},
journal= {arXiv preprint arXiv:1905.01422},
year = {2020}
}
备注
The generalization is improved by modifying the preconditioner. For training ResNet-50 on ImageNet, ARSG outperforms ADAM in convergence speed and meanwhile it surpasses SGD in generalization. We also present a convergence bound in non-convex settings