AdaSGD:弥合 SGD 与 Adam 之间的差距
机器学习
2020-07-01 v1 机器学习
摘要
在随机梯度下降(SGD)与自适应矩估计(Adam)的背景下,研究者近期提出了从 Adam 过渡到 SGD 的优化技术,旨在改善收敛性与泛化性能。然而,每种方法如何权衡早期进展与泛化尚不清晰;因此,何时甚至是否应从一种方法过渡到另一种方法并不明确。本工作中,我们首先研究凸设置,识别出导致 SGD 与 Adam 之间观测性能差异的潜在因素。具体而言,我们提供了 Adam 何时以及为何优于 SGD,反之亦然的理论见解。我们通过为 SGD 适配单一全局学习率来弥合性能差距,称之为 AdaSGD。我们以非凸设置下的实证分析论证了这一提出的方法。在跨越三个不同领域的多个数据集上,我们展示了 AdaSGD 如何结合 SGD 与 Adam 两者的优势,消除了从 Adam 过渡到 SGD 的方法之需。
引用
@article{arxiv.2006.16541,
title = {AdaSGD: Bridging the gap between SGD and Adam},
author = {Jiaxuan Wang and Jenna Wiens},
journal= {arXiv preprint arXiv:2006.16541},
year = {2020}
}