中文

预热稳定衰减的普适动力学:超越Transformer理解WSD

机器学习 2026-01-15 v1

摘要

预热稳定衰减学习率调度器最近变得流行,主要归功于其在训练大型语言模型时的良好性能和灵活性。WSD的显著性能——与余弦衰减相比,仅在训练的一小部分使用衰减学习率——是否是特定于基于Transformer的语言模型的现象,并且可能为其训练动力学提供新的理论见解,这仍然是一个悬而未决的问题。受使用学习率调度器作为理解损失景观几何(例如,河谷、连通最小值、渐进锐化)的新视角的启发,在这项工作中,我们比较了Adam优化器在类似Pythia的语言模型上的WSD路径与在CIFAR10图像分类的小型CNN上的路径。我们观察到大多数训练信号、优化器路径特征和锐度动力学在这些架构中定性相似。这种一致性指向新旧非凸问题的损失景观的共享几何特征,并暗示了关于高维优化问题几何的未来研究问题。

关键词

引用

@article{arxiv.2601.09000,
  title  = {Universal Dynamics of Warmup Stable Decay: understanding WSD beyond Transformers},
  author = {Annalisa Belloni and Lorenzo Noci and Antonio Orvieto},
  journal= {arXiv preprint arXiv:2601.09000},
  year   = {2026}
}

备注

Accepted at the 2025 HiLD and MOSS Workshops at ICML