中文

无学习率衰减的预训练增强监督微调表现

计算与语言 2026-03-18 v1 机器学习

摘要

我们研究了在大规模预训练中使用学习率调度策略的作用,聚焦其对监督微调(SFT)后下游性能的影响。基于衰减的学习率调度器广泛用于最小化预训练损失。然而,尽管其使用广泛,如何影响 SFT 后的性能仍未充分探讨。本文考察了仅做 warmup 且维持恒定学习率(Warmup-Stable-Only, WSO)的做法。通过在 1B 和 8B 参数模型上进行实验,我们发现 WSO 在 SFT 后的性能上始终优于基于衰减的调度器,尽管后者在预训练后可能表现更好。该结果在不同训练阶段(中期训练和过度训练)下仍成立。损失景观分析进一步表明,基于衰减的调度器会使模型陷入更尖锐的最小值,而 WSO 保持更平坦的最小值,支持更好的适应性。这些发现表明,对预训练指标进行学习率衰减处理可能损害下游适应性。我们的工作也为训练策略和模型发布提供了实际指导,表明采用 WSO 进行预训练可提升模型对下游任务的适应性。

关键词

引用

@article{arxiv.2603.16127,
  title  = {Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning},
  author = {Kazuki Yano and Shun Kiyono and Sosuke Kobayashi and Sho Takase and Jun Suzuki},
  journal= {arXiv preprint arXiv:2603.16127},
  year   = {2026}
}

备注

25 pages, accepted by ICLR 2026 as a conference paper