中文

通过从 Adam 切换到 SGD 提升泛化性能

机器学习 2017-12-21 v1 最优化与控制

摘要

尽管训练结果更优,但诸如 Adam、Adagrad 或 RMSprop 的自适应优化方法被发现相比随机梯度下降(SGD)泛化较差。这些方法在训练初期往往表现良好,但在训练后期被 SGD 超越。我们研究一种混合策略,其以自适应方法开始训练,并在适当时切换至 SGD。具体而言,我们提出 SWATS,一种在触发条件满足时从 Adam 切换至 SGD 的简单策略。我们提出的条件涉及 Adam 步长在梯度子空间上的投影。按设计,该条件的监测过程开销极小,且不增加优化器中的超参数数量。我们报告了在若干标准基准上的实验,如:CIFAR-10 与 CIFAR-100 数据集上的 ResNet、SENet、DenseNet 和 PyramidNet,tiny-ImageNet 数据集上的 ResNet,以及 PTB 和 WT2 数据集上基于循环网络的语言建模。结果表明,我们的策略能够在大多数任务上弥合 SGD 与 Adam 之间的泛化差距。

关键词

引用

@article{arxiv.1712.07628,
  title  = {Improving Generalization Performance by Switching from Adam to SGD},
  author = {Nitish Shirish Keskar and Richard Socher},
  journal= {arXiv preprint arXiv:1712.07628},
  year   = {2017}
}