中文

如何设定大规模预训练的学习率?

人工智能 2026-01-09 v1

摘要

学习率(LR)的最优配置是大尺度预训练中一项基础且艰巨的挑战。鉴于训练成本与模型性能之间的严苛权衡,核心问题在于能否从低成本实验中精确外推出最优 LR。本文将这一研究形式化为两种不同的研究范式:拟合与迁移。在拟合范式内,我们创新性地引入了搜索因子的 Scaling Law,通过预测建模将搜索复杂度从 O(n^3) 有效降低至 O(n*C_D*C_{\eta})。在迁移范式内,我们将 μ\muTransfer 的原理扩展至 Mixture of Experts (MoE) 架构,拓宽了其适用范围以涵盖模型深度、权重衰减和 token 预算。通过在规模上突破现有超参数研究的边界,我们对这两种范式进行了全面比较。我们的实证结果挑战了被广泛采用的 μ\muTransfer 在大规模预训练场景中的可扩展性。此外,我们通过训练稳定性和特征学习的双重视角提供了严谨分析,以阐明逐模块参数调优在大规模设置下表现不佳的深层原因。这项工作为优化工业级预训练提供了系统的实用指南和全新的理论视角。

关键词

引用

@article{arxiv.2601.05049,
  title  = {How to Set the Learning Rate for Large-Scale Pre-training?},
  author = {Yunhua Zhou and Shuhao Xing and Junhao Huang and Xipeng Qiu and Qipeng Guo},
  journal= {arXiv preprint arXiv:2601.05049},
  year   = {2026}
}