中文

时间迁移:无限数据极限下的最优学习率和批大小

机器学习 2025-01-10 v2 人工智能

摘要

大规模语言模型(LLM)最优缩放的主要挑战之一是超参数调优的过高成本,特别是学习率η\eta和批大小BB。虽然像μ\muP (Yang et al., 2022)这样的技术提供了在无限模型大小极限下最优η\eta迁移的缩放规则,但在无限数据大小极限下的最优缩放行为仍然未知。我们通过首次观察到最优η\eta缩放与预训练token预算TTBB及其与临界批大小BcritB_\mathrm{crit}的关系之间存在复杂的依赖关系,填补了这一空白。我们测量到BcritTB_\mathrm{crit} \propto T。此外,我们表明最优批大小与BcritB_\mathrm{crit}正相关:即使学习率被最优缩放,保持批大小固定也会随时间变得次优。令人惊讶的是,我们的结果表明,观察到的最优η\etaBB动态在μ\muP模型缩放下得以保持,这挑战了BcritB_\mathrm{crit}仅依赖于损失值的传统观点。作为最优性的补充,我们考察了损失对学习率变化的敏感性,发现敏感性随TT的增加而降低,并在μ\muP模型缩放下保持不变。我们希望我们的结果能朝着统一的最优数据和模型缩放图景迈出第一步。

关键词

引用

@article{arxiv.2410.05838,
  title  = {Time Transfer: On Optimal Learning Rate and Batch Size In The Infinite Data Limit},
  author = {Oleg Filatov and Jan Ebert and Jiangtao Wang and Stefan Kesselheim},
  journal= {arXiv preprint arXiv:2410.05838},
  year   = {2025}
}