高维非凸优化问题中的最优学习率调度
机器学习
2022-02-10 v1 机器学习
摘要
学习率调度被广泛用于加速并改进优化。许多不同的策略在经验基础上被提出,且针对凸设定已发展出理论分析。然而,在许多现实问题中,损失景观是高维且非凸的——对此情形结果稀少。本文首次解析地研究了学习率调度在此设定中的作用,聚焦于学习率按 衰减的 Langevin 优化。我们首先考虑损失为 维球面上()高斯随机函数、具有大量临界点的模型。我们发现,为加速优化且不被鞍点困住,必须选择衰减率 ,这与凸设定中通常最优的 相反。我们随后向问题中加入待恢复的信号。在此设定下,动力学分解为两个阶段:动力学穿越景观粗糙部分的\emph{探索}阶段,随后是检测到信号且动力学进入凸盆地的\emph{收敛}阶段。此情形下,最优做法是在探索阶段保持大学习率以尽快逃离非凸区域,然后使用凸判据 快速收敛至解。最后,我们证明我们的结论在涉及神经网络的常见回归任务中成立。
引用
@article{arxiv.2202.04509,
title = {Optimal learning rate schedules in high-dimensional non-convex optimization problems},
author = {Stéphane d'Ascoli and Maria Refinetti and Giulio Biroli},
journal= {arXiv preprint arXiv:2202.04509},
year = {2022}
}