攀登边缘:基于曲率的学习率调节器
机器学习
2024-07-09 v1
摘要
曲率信息——特别是损失 Hessian 最大特征值的锐度,往往是学习率调节器的基础。然而,近期研究表明,曲率信息在训练期间经历复杂动力学,从不稳定阶段转向最终稳定。我们分析了学习率调节与曲率之间的闭环反馈效应。我们发现,经典学习率调节器虽在单步损失减少方面表现更好,但在完整小批量情形下与恒定学习率相比最终表现不佳。这些模型会破坏锐度的稳定,我们通过简化的学习率与曲率联合动力学模型解释了这一现象。为进一步探讨这些效应,我们引入了新的学习率调节方法——曲率动力学感知调节器(CDAT),其优先考虑长期曲率稳定性而非目标函数的即时进度。在完整小批量情形下,CDAT 的行为类似于前缀式预热计划,对深度学习目标表现出优势。在小批量情形下,我们观察到随机性引入的混淆效应解释了某些学习率调节器在合适批量大小下成功的原因。我们的发现凸显了理解学习率与曲率联合动力学的关键作用——超越贪心最小化——以诊断故障并设计有效的自适应学习率调节器的必要性。
引用
@article{arxiv.2407.06183,
title = {Stepping on the Edge: Curvature Aware Learning Rate Tuners},
author = {Vincent Roulet and Atish Agarwala and Jean-Bastien Grill and Grzegorz Swirszcz and Mathieu Blondel and Fabian Pedregosa},
journal= {arXiv preprint arXiv:2407.06183},
year = {2024}
}