步长任选:面向预算迭代训练的统一学习率调度
机器学习
2025-12-09 v4
摘要
不断增长的计算成本和有限的资源凸显了预算迭代训练的关键需求,该训练旨在预定的迭代预算内实现最优学习。尽管学习率调度从根本上决定了不同网络和任务的性能,尤其是在预算迭代场景中,但其设计在很大程度上仍是启发式的,缺乏理论基础。此外,最优学习率调度需要大量的试错选择,使得训练过程效率低下。在本工作中,我们提出了统一预算感知(UBA)调度,这是一种有理论依据的学习率调度,在不同的受限训练预算下,其在多样的架构和任务中始终优于常用的调度。首先,我们通过构建一个新颖的训练预算感知优化框架来弥合这一差距,该框架明确考虑了对景观曲率变化的鲁棒性。从这个框架中,我们推导出了 UBA 调度,它由单个超参数 \varphi 控制,在灵活性和简单性之间提供了折中,消除了针对每个网络进行数值优化的需要。此外,我们建立了 \varphi 与条件数之间的理论联系,为我们的方法增加了可解释性和正当性。另外,我们证明了不同 \varphi 值的收敛性。我们通过理论分析和实证结果为其选择提供了实用指南。广泛的实验结果表明,在不同的训练迭代预算下,UBA 在跨越网络架构(例如 ResNet、OLMo)和规模的多样视觉和语言任务中始终超越常用的调度。
引用
@article{arxiv.2505.24452,
title = {Stepsize anything: A unified learning rate schedule for budgeted-iteration training},
author = {Anda Tang and Yiming Dong and Yutao Zeng and zhou Xun and Zhouchen Lin},
journal= {arXiv preprint arXiv:2505.24452},
year = {2025}
}