中文

堆叠你的Transformer:高效LLM预训练中模型增长的深入探究

计算与语言 2024-10-23 v2 人工智能

摘要

由于规模庞大,LLM的预训练在计算上非常昂贵。模型增长作为一种有前景的方法出现,通过利用较小的模型来加速较大模型的训练。然而,这些模型增长方法在高效LLM预训练中的可行性仍未得到充分探索。本工作识别了三个关键障碍:(O1)缺乏全面评估,(O2)可扩展性未经测试,(O3)缺乏经验指导。为了解决O1,我们将现有方法总结为四个原子增长算子,并在标准化的LLM预训练设置中系统地评估它们。我们的发现表明,一种称为GstackG_{\text{stack}}的深度堆叠算子在训练中表现出显著的加速,导致损失降低,并在八个标准NLP基准测试中相比强基线获得了整体性能提升。受这些有希望的结果的启发,我们进行了大量实验以更深入地研究GstackG_{\text{stack}},以解决O2和O3。对于O2(未经测试的可扩展性),我们的研究表明GstackG_{\text{stack}}是可扩展的,并且表现一致,实验涉及增长后的7B LLM以及使用750B token预训练的LLM。例如,与使用300B token常规训练的7B模型相比,我们的GstackG_{\text{stack}}模型使用194B token收敛到相同的损失,实现了54.6%的加速。我们进一步通过形式化确定GstackG_{\text{stack}}的增长时机和增长因子的指导方针来解决O3(缺乏经验指导),使其在通用LLM预训练中实用。我们还提供了GstackG_{\text{stack}}的深入讨论和全面的消融研究。我们的代码和预训练模型可在https://llm-stacking.github.io获取。

关键词

引用

@article{arxiv.2405.15319,
  title  = {Stacking Your Transformers: A Closer Look at Model Growth for Efficient LLM Pre-Training},
  author = {Wenyu Du and Tongxu Luo and Zihan Qiu and Zeyu Huang and Yikang Shen and Reynold Cheng and Yike Guo and Jie Fu},
  journal= {arXiv preprint arXiv:2405.15319},
  year   = {2024}
}

备注

NeurIPS 2024 Spotlight