中文

AdaBound的收敛性及其与SGD的关联

机器学习 2019-12-11 v2 最优化与控制 机器学习

摘要

诸如Adam之类的自适应梯度方法由于在训练复杂神经网络方面的成功以及对超参数调优较SGD更不敏感而极度流行。然而,最近研究表明Adam可能不收敛并导致较差的泛化能力——这促使人们设计新的、复杂的自适应方法,试图在泛化良好且具有理论可靠性的同时取得平衡。在本技术报告中,我们关注AdaBound,一种有前景的、近期提出的优化器。我们给出一个随机凸问题,对此AdaBound在Luo等人(2019)收敛速率保证中未计入的因子意义上可被证明花费任意长时间才收敛。我们在对边界函数不同假设下给出新的O(T)O(\sqrt T)遗憾保证,并提供在CIFAR上的实证结果,表明特定形式的动量SGD能以更少超参数和更低计算成本匹配AdaBound的性能。

关键词

引用

@article{arxiv.1908.04457,
  title  = {On the Convergence of AdaBound and its Connection to SGD},
  author = {Pedro Savarese},
  journal= {arXiv preprint arXiv:1908.04457},
  year   = {2019}
}