中文

晚到早训练:LET 让大语言模型更快学到更好的知识

计算与语言 2026-02-06 v1 机器学习

摘要

随着大规模语言模型(LLM)通过扩大模型和数据规模取得显著经验成功,预训练变得越来越关键却又 computationally prohibitive(计算上不可行),阻碍了快速发展。尽管有众多通过大量计算开支开发的预训练 LLM,但一个根本现实问题仍未被充分探讨:我们能否利用现有的小型预训练模型来加速更大模型的训练?本文提出了一种晚到早训练(Late-to-Early Training, LET)范式,使 LLM 能够在更早的步骤和更早的层上显式学习后期知识。核心思想是利用预训练模型(即晚期训练阶段)的后层表示来指导 LLM 早期层的训练。我们识别了两种驱动 LET 有效性的关键机制:晚到早步骤学习和晚到早层学习。这些机制显著加速训练收敛,同时稳健地提升了语言建模能力和下游任务性能,实现更快的训练且性能更优。对 14 亿和 70 亿参数模型进行大量实验表明,LET 的效率和效果均令人满意。值得注意的是,在 Pile 数据集上训练 14 亿参数 LLM 时,我们的方法可实现最高达 1.6 倍的加速,与标准训练相比,下游任务准确率提升近 5%,即使使用参数是目标模型 10 倍更少的预训练模型。

关键词

引用

@article{arxiv.2602.05393,
  title  = {Late-to-Early Training: LET LLMs Learn Earlier, So Faster and Better},
  author = {Ji Zhao and Yufei Gu and Shitong Shao and Xun Zhou and Liang Xiang and Zeke Xie},
  journal= {arXiv preprint arXiv:2602.05393},
  year   = {2026}
}