ScheduleFree+: 大语言模型上的无学习率-free 与无调度-free 学习的扩展
机器学习
2026-05-20 v1 人工智能
机器学习
摘要
Schedule-Free Learning 在诸多标准基准问题上已显示出作为实用即时训练方法的前景,但仅在小规模模型上证明了强性能。我们识别出将 Schedule-Free Learning 拓展到更大 batch size 和模型规模所必需的若干修正,并提出一种无学习率-free 与无调度-free 方法(ScheduleFree+),用于训练大型语言模型,显著优于 Warmup-Stable-Decay(WSD)调度方案。我们还展示了 Schedule-Free Learning 在长期训练中最为有效,在每参数 1000 个 token 时,其性能比 SOTA 调度提升 31%。Schedule-Free Learning 为在预训练期间使用模型平均和 checkpoint 合并提供了理论基础。
引用
@article{arxiv.2605.19095,
title = {ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models},
author = {Aaron Defazio},
journal= {arXiv preprint arXiv:2605.19095},
year = {2026}
}