中文

LLM 预训练中的课程学习:学习动力学分析

机器学习 2026-05-12 v2 人工智能

摘要

课程学习改变预训练数据的顺序,但其如何影响学习动力学仍不清晰。我们在从 14M 到 1B 参数规模下进行 3000 亿 token 的预训练,分别采用三种以语言学为导向的课程--年龄-获取 (Age-of-Acquisition)、词频 和 动词变体 (Verb Variation, VV)--以及随机排序进行比较。我们分析了潜在训练阶段、梯度噪声尺度 (GNS) 以及输出头的奇异值结构。我们发现训练遵循相同的潜在阶段序列,而课程主要影响每个阶段的时间分配。随机排序在 14M-70M 参数规模下产生更高的 GNS,并在 160M 参数规模下出现晚期奇异熵尖峰,表明梯度更嘈杂且输出头饱和。反序 VV 控制显示顺序至关重要:降序排列会丧失升序课程所具有的准确性优势。在更大规模下,这些稳定性差异较小。这些结果表明,本文研究的课程与更稳定的阶段内训练相关,而非创建新的训练阶段。

关键词

引用

@article{arxiv.2601.21698,
  title  = {Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics},
  author = {Mohamed Elgaar and Hadi Amiri},
  journal= {arXiv preprint arXiv:2601.21698},
  year   = {2026}
}