通过自适应 Polyak 步长走更少调度的道路
机器学习
2026-05-13 v2
摘要
Schedule-Free SGD 于 [Defazio 等, 2024] 提出后,便实现了无需提前知晓训练时程即可达到最优收敛率,通过用一种以原则为导驱动的迭代平均形式取代学习率调度器。然而,该方法仍需要调整基本学习率,其最优值取决于未知问题常数。本文沿着这一道路继续前进,通过推导 Schedule-Free SGD 和 Adam 的 Polyak 类型步长,从样本损失、梯度和当前迭代中计算每个迭代的学习率。我们首先提出一种 oracle 变体,使用每个样本的最优函数值,并证明了针对凸 Lipschitz 目标函数的 O(1/√t) 任意时段最后迭代速率。随后我们去除了 oracle 要求,提出一种受保护的变体,用任何可用的下界取代未知的最优值,实现相同速率(在插值情形下收敛到邻域)。两种步长方法均简化为当动量为零时标准 SGD 的现有 Polyak 规则,统一了标准和无调度 Polyak 方法。数值实验在语言建模任务中(包括预训练和蒸馏),显示所提方法在保持更高鲁棒性的同时,匹配或超越调校过的 Schedule-Free 基线。
引用
@article{arxiv.2511.07767,
title = {Taking the Road Less Scheduled with Adaptive Polyak Steps},
author = {Dimitris Oikonomou and Matthew Buchholz and Yuen-Man Pun and Robert M. Gower and Nicolas Loizou},
journal= {arXiv preprint arXiv:2511.07767},
year = {2026}
}