时间迁移:无限数据极限下的最优学习率和批大小
机器学习
2025-01-10 v2 人工智能
摘要
大规模语言模型(LLM)最优缩放的主要挑战之一是超参数调优的过高成本,特别是学习率和批大小。虽然像P (Yang et al., 2022)这样的技术提供了在无限模型大小极限下最优迁移的缩放规则,但在无限数据大小极限下的最优缩放行为仍然未知。我们通过首次观察到最优缩放与预训练token预算、及其与临界批大小的关系之间存在复杂的依赖关系,填补了这一空白。我们测量到。此外,我们表明最优批大小与正相关:即使学习率被最优缩放,保持批大小固定也会随时间变得次优。令人惊讶的是,我们的结果表明,观察到的最优和动态在P模型缩放下得以保持,这挑战了仅依赖于损失值的传统观点。作为最优性的补充,我们考察了损失对学习率变化的敏感性,发现敏感性随的增加而降低,并在P模型缩放下保持不变。我们希望我们的结果能朝着统一的最优数据和模型缩放图景迈出第一步。
引用
@article{arxiv.2410.05838,
title = {Time Transfer: On Optimal Learning Rate and Batch Size In The Infinite Data Limit},
author = {Oleg Filatov and Jan Ebert and Jiangtao Wang and Stefan Kesselheim},
journal= {arXiv preprint arXiv:2410.05838},
year = {2025}
}