中文

大语言模型的时间缩放律

计算与语言 2025-09-23 v4

摘要

最近,大语言模型(Large Language Models, LLMs)已被广泛采用于各种任务中,导致人们越来越关注研究缩放 LLMs 如何影响其性能的研究。现有工作被称为缩放律,发现 LLMs 的最终测试损失与模型大小、计算预算和数据集大小呈幂律关系。然而,LLM 在其预训练过程中测试损失的时间变化仍未被探索,尽管它在许多方面很有价值,例如直接在目标 LLM 上选择更好的超参数。在本文中,我们提出了时间缩放律的新概念,研究 LLM 的测试损失如何随训练步数的增加而演变。与以粗粒度方式将测试损失作为整体进行建模不同,我们将其分解,深入探究每个 token 位置的细粒度测试损失,并进一步开发了一种动态双曲律。随后,通过研究动态双曲律中参数的时间模式,我们推导出了更为精确的时间缩放律。在分布内(in-distribution, ID)和分布外(out-of-distribution, OOD)验证数据集上的结果表明,我们的时间缩放律能准确预测 LLM 在各训练步数上的测试损失。我们的时间缩放律具有广泛的实际应用。首先,它能够在目标 LLM 上直接且高效地选择超参数,例如数据混合比例。其次,从 token 位置粒度审视 LLM 预训练动态,为增强对 LLM 预训练的理解提供了见解。

关键词

引用

@article{arxiv.2404.17785,
  title  = {Temporal Scaling Law for Large Language Models},
  author = {Yizhe Xiong and Xiansheng Chen and Xin Ye and Hui Chen and Zijia Lin and Haoran Lian and Zhenpeng Su and Wei Huang and Jianwei Niu and Jungong Han and Guiguang Ding},
  journal= {arXiv preprint arXiv:2404.17785},
  year   = {2025}
}

备注

Accepted by EMNLP'25 Main Conference (Oral presentation), Camera-ready version