中文

跨标记范围扩展最优学习率

机器学习 2025-02-25 v3 人工智能 计算与语言

摘要

最先进的大语言模型 (LLM) 以规模化为核心动力 — 规模化模型大小、数据集大小和集群规模。对于最大规模运行, 不经济对超参数进行广泛调优。相反, 必须从较小实验中推断或传递约最优超参数。模型规模上的超参数传递已在 Yang 等人工作中研究。然而, 数据集规模上的超参数传递 — 或标记范围上的传递尚未得到研究。为此我们进行大规模经验研究, 探讨最优学习率 (LR) 如何随标记范围变化。我们首先表明, 最优 LR 随标记范围发生显著变化 — 较长的训练需要更小的 LR。其次, 我们表明, 最优 LR 遵循规模定律, 较长时间范围的 LR 可通过此类规模定律从较短时间范围准确估计。我们还提供一种在当前实践中零开销的跨标记范围传递 LR 的经验法则。最后我们提供证据表明 Llama-1 使用的 LR 过高, 并估计了这带来的性能损失。我们因此论证, 数据集规模上的超参数传递是 LLM 训练中一个重要且被忽视的组成部分。

关键词

引用

@article{arxiv.2409.19913,
  title  = {Scaling Optimal LR Across Token Horizons},
  author = {Johan Bjorck and Alon Benhaim and Vishrav Chaudhary and Furu Wei and Xia Song},
  journal= {arXiv preprint arXiv:2409.19913},
  year   = {2025}
}

备注

Accepted at ICLR 2025