通过更新的在线学习理解 Adam 优化器:Adam 是伪装的 FTRL
机器学习
2024-05-31 v2 最优化与控制
摘要
尽管 Adam 优化器在实践中取得了成功,但对其算法组件的理论理解仍然有限。特别是,现有的大多数 Adam 分析显示的收敛速度,可以通过像 SGD 这样的非自适应算法简单实现。在这项工作中,我们基于在线学习提供了一个不同的视角,强调了 Adam 算法组件的重要性。受 Cutkosky 等人 (2023) 的启发,我们考虑了一个称为更新/增量在线学习的框架,在该框架中,我们基于在线学习器选择优化器的更新/增量。借助这个框架,设计一个好的优化器就简化为设计一个好的在线学习器。我们的主要观察是,Adam 对应于一个名为“跟随正则化领导者” (FTRL) 的原则性在线学习框架。基于这一观察,我们从在线学习的角度研究了其算法组件的优势。
引用
@article{arxiv.2402.01567,
title = {Understanding Adam Optimizer via Online Learning of Updates: Adam is FTRL in Disguise},
author = {Kwangjun Ahn and Zhiyu Zhang and Yunbum Kook and Yan Dai},
journal= {arXiv preprint arXiv:2402.01567},
year = {2024}
}
备注
Accepted at ICML 2024