关于深度学习优化器的经验比较
机器学习
2020-06-17 v3 机器学习
摘要
选择优化器是当代深度学习流程中的核心步骤。在本文中,我们展示了优化器比较对超参数调优协议的敏感性。我们的研究结果表明,超参数搜索空间可能是解释文献中近期经验比较所得排名的单一最重要因素。事实上,我们表明当超参数搜索空间改变时,这些结果可能被推翻。随着调优努力无限增长,更通用的优化器绝不应逊于它们所能近似的优化器(即 Adam 绝不应比 momentum 表现差),但近期比较优化器的尝试要么假设这些包含关系在实践中不相关,要么以破坏包含关系的方式限制超参数。在我们的实验中,我们发现优化器之间的包含关系在实践中至关重要,并且总能预测优化器比较的结果。特别地,我们发现流行的自适应梯度方法从未逊于 momentum 或梯度下降。我们还报告了关于调优自适应梯度方法中常被忽略的超参数的实用技巧,并对神经网络训练中优化器的公平基准测试提出担忧。
引用
@article{arxiv.1910.05446,
title = {On Empirical Comparisons of Optimizers for Deep Learning},
author = {Dami Choi and Christopher J. Shallue and Zachary Nado and Jaehoon Lee and Chris J. Maddison and George E. Dahl},
journal= {arXiv preprint arXiv:1910.05446},
year = {2020}
}