理解为何 Adam 比 SGD 更快收敛于 Transformer 的训练
机器学习
2023-06-02 v1 人工智能
摘要
尽管随机梯度下降(SGD)仍是深度学习中最为流行的优化算法,但诸如 Adam 之类的自适应算法已在部分深度学习应用(如训练 transformer)中确立了对 SGD 的经验优势。然而,为何在这些场景下 Adam 显著快于 SGD 仍是一个问题。本文中,我们利用新概念方向锐度(directional sharpness)对 Adam 快于 SGD 的原因给出一种解释。我们认为优化算法的性能与更新步的方向锐度密切相关,并表明 SGD 相比自适应算法具有差得多的方向锐度。我们进一步观察到仅一小部分坐标导致了 SGD 的不良锐度与缓慢收敛,并提出使用坐标级裁剪作为 SGD 及其他优化算法的解决方案。我们在多种设置下展示了坐标级裁剪对降低锐度及加速优化算法收敛的作用。我们表明当仅一小部分坐标具有不良锐度时,坐标级裁剪改善了局部损失下降。我们得出结论:自适应坐标级缩放的锐度降低效应是 Adam 在实践中成功的原因,并建议将坐标级裁剪用作加速深度学习优化的通用技术。
引用
@article{arxiv.2306.00204,
title = {Toward Understanding Why Adam Converges Faster Than SGD for Transformers},
author = {Yan Pan and Yuanzhi Li},
journal= {arXiv preprint arXiv:2306.00204},
year = {2023}
}
备注
37 pages, 16 figures