块自适应:深度学习中的更快训练与更好泛化
机器学习
2019-05-27 v1 最优化与控制
机器学习
摘要
具有坐标级自适应步长(如 RMSprop 和 Adam)的随机方法已广泛用于深度神经网络的训练。尽管它们收敛迅速,但泛化性能可能劣于随机梯度下降。本文通过重新审视 Adagrad 的设计,提出将网络参数分块并使用块级自适应步长。直观上,块自适应不如对单个坐标的自适应激进,能在自适应与泛化之间取得更好平衡。我们从理论上证明,所提出的块自适应梯度下降与坐标级自适应步长对应方法具有可比的收敛速率,但至多快一个常数因子。我们还研究了其一致稳定性,并表明块自适应可比坐标自适应带来更低的泛化误差。实验结果表明,块自适应梯度下降比 Nesterov 加速梯度和 Adam 收敛更快且提升了泛化性能。
引用
@article{arxiv.1905.09899,
title = {Blockwise Adaptivity: Faster Training and Better Generalization in Deep Learning},
author = {Shuai Zheng and James T. Kwok},
journal= {arXiv preprint arXiv:1905.09899},
year = {2019}
}