机器学习中自适应梯度方法的边际价值
机器学习
2018-05-23 v2 机器学习
摘要
自适应优化方法利用由迭代历史构建的度量进行局部优化,在训练深度神经网络中正变得越来越流行。典型例子包括 AdaGrad、RMSProp 和 Adam。我们证明,对于简单的过参数化问题,自适应方法找到的解往往与梯度下降(GD)或随机梯度下降(SGD)截然不同。我们构造了一个说明性的二分类问题,其中数据是线性可分的,GD 和 SGD 达到了零测试误差,而 AdaGrad、Adam 和 RMSProp 达到的测试误差可以任意接近一半。我们还额外研究了自适应方法在多个 SOTA 深度学习模型上的经验泛化能力。我们观察到,即使自适应方法找到的解具有更好的训练性能,其泛化能力也比 SGD 更差(通常显著更差)。这些结果表明,从业者应重新考虑使用自适应方法来训练神经网络。
引用
@article{arxiv.1705.08292,
title = {The Marginal Value of Adaptive Gradient Methods in Machine Learning},
author = {Ashia C. Wilson and Rebecca Roelofs and Mitchell Stern and Nathan Srebro and Benjamin Recht},
journal= {arXiv preprint arXiv:1705.08292},
year = {2018}
}