中文

无调度非凸优化的分析

机器学习 2025-08-12 v1 人工智能

摘要

一阶方法支撑着大多数大规模学习算法,但它们的经典收敛保证依赖于依赖于总时域 TT 的精心安排的步长,这在实际中往往难以提前知道。Schedule-Free (SF) 方法通过在 Polyak--Ruppert 平均与动量之间进行插值,承诺以与 TT 无关的超参数实现最优性能,但非凸 SF 的分析已受到限制或依赖于强大的全局假设。在本文中,我们引入了一个稳健的 Lyapunov 框架,该框架仅基于 LL-smoothness 和下界,使 SF 分析简化为单个步骤的下降不等式。这产生了非凸情形下的时域无关界限:对于常数步长 + PR 平均,为 O(1/logT)O(1/\log T);对于线性增长步长,为 O(logT/T)O(\log T/T);对于多项式平均,为一系列 O(T(1α))O(T^{-(1-\alpha)}) 速率。我们用性能估计问题 (PEP) 实验补充这些证明,对我们的速率进行数值验证,并提示我们对原始非凸 SF 算法的 O(1/logT)O(1/\log T) 界限可能紧缩为 O(1/T)O(1/T)。我们的工作将 SF 的时域自由保证扩展到光滑非凸优化,并为最优非凸速率绘制了未来方向。

关键词

引用

@article{arxiv.2508.06743,
  title  = {Analysis of Schedule-Free Nonconvex Optimization},
  author = {Connor Brown},
  journal= {arXiv preprint arXiv:2508.06743},
  year   = {2025}
}