中文

学习率工程:从粗糙的单一参数到分层演化

人工智能 2026-05-01 v1 机器学习

摘要

学习率调度的演进从早期SGD的单一全局固定速率,发展到精细化的分层自适应策略。我们将这种演进系统化地归纳为五个阶段:(Gen1)全局固定学习率、(Gen2)全局调度、(Gen3)参数级自适应、(Gen4)层级差异化、和(Gen5)联合层级-时间调度。我们追溯每一次转变背后的根本动机,展示了从“一条鞭法”到按层次和时间量身定制,如何解决迁移学习中的不可能三角问题:下层需要小更新以保留通用知识,而上层需要大更新以适应新任务。建立在此分类基础上,我们提出判别性自适应层级缩放(Discriminative Adaptive Layer Scaling, DALS),一个统一框架,将相位自适应余弦调度、深度感知Grokfast梯度过滤和LARS式信任比合并为单一的连贯优化器。我们在五个数据集上对18种策略进行基准测试,包括三个DALS变体,覆盖所有五个阶段:合成数据、CIFAR-10(从头训练)、RTE、TREC-6和IMDb(微调)。在合成数据上,DALS以98.0%的最佳准确率实现最佳性能,DALS-Fast仅需3个epoch即可达到90%。跨数据集分析揭示了显著的 regime 依赖模式——没有单一策略能在所有 regime 下获胜。关键的是,STLR+判别性,ULMFiT的冠军,在从头训练任务上会 catastrophic 失败(TREC-6从头训练仅43.6%准确率,而RAdam可达96.8%),确认了在没有预训练特征时,方向性衰减会造成严重偏差。DALS既避免了极端,又实现了最佳合成结果,同时保持了竞争的微调性能。

关键词

引用

@article{arxiv.2604.27295,
  title  = {Learning Rate Engineering: From Coarse Single Parameter to Layered Evolution},
  author = {Ming-Hong Yao and Di Wang and Jian Cui and Jin-Yan Chen and Zi-Hao Cui and Fa Wang and Chen Wei and Qiu-Ye Yu},
  journal= {arXiv preprint arXiv:2604.27295},
  year   = {2026}
}

备注

16 pages, 5 figures, 3 tables