中文

AdaSGD:弥合 SGD 与 Adam 之间的差距

机器学习 2020-07-01 v1 机器学习

摘要

在随机梯度下降(SGD)与自适应矩估计(Adam)的背景下,研究者近期提出了从 Adam 过渡到 SGD 的优化技术,旨在改善收敛性与泛化性能。然而,每种方法如何权衡早期进展与泛化尚不清晰;因此,何时甚至是否应从一种方法过渡到另一种方法并不明确。本工作中,我们首先研究凸设置,识别出导致 SGD 与 Adam 之间观测性能差异的潜在因素。具体而言,我们提供了 Adam 何时以及为何优于 SGD,反之亦然的理论见解。我们通过为 SGD 适配单一全局学习率来弥合性能差距,称之为 AdaSGD。我们以非凸设置下的实证分析论证了这一提出的方法。在跨越三个不同领域的多个数据集上,我们展示了 AdaSGD 如何结合 SGD 与 Adam 两者的优势,消除了从 Adam 过渡到 SGD 的方法之需。

关键词

引用

@article{arxiv.2006.16541,
  title  = {AdaSGD: Bridging the gap between SGD and Adam},
  author = {Jiaxuan Wang and Jenna Wiens},
  journal= {arXiv preprint arXiv:2006.16541},
  year   = {2020}
}