全局-局部光滑性:线搜索与自适应步长在理论上同样有效!
最优化与控制
2026-05-19 v2 机器学习
摘要
使用一阶算法优化光滑函数的迭代复杂度通常以梯度的全局Lipschitz常数来表述,并通过固定步长实现近最优结果。然而,实践中出现的许多目标函数存在Lipschitz常数较小的区域,在这些区域可以使用更大的步长。已有许多局部Lipschitz假设被提出,相关结果表明自适应步长和/或线搜索相比固定步长能获得更优的收敛速度。然而,这些更快的速度往往依赖于算法的迭代点,这使得比较不同方法的迭代复杂度变得困难。我们考虑一种仅依赖于函数性质的全局与局部(“glocal”)光滑性的简单刻画。这使得迭代复杂度的上界可以用与迭代点无关的常数表示,并使我们能够比较不同算法之间的迭代复杂度。在此假设下,可以简洁地证明线搜索相对于固定步长的优势,并且在某些情况下,带线搜索的梯度下降比带固定步长的加速方法具有更好的迭代复杂度。我们进一步表明,glocal光滑性可以为Polyak和AdGD步长以及其他算法(包括坐标优化、随机梯度方法、加速梯度方法和非线性共轭梯度方法)带来改进的复杂度。
引用
@article{arxiv.2506.12648,
title = {Glocal Smoothness: Line search and adaptive step sizes can help in theory too!},
author = {Curtis Fox and Aaron Mishkin and Sharan Vaswani and Mark Schmidt},
journal= {arXiv preprint arXiv:2506.12648},
year = {2026}
}