堆叠你的Transformer:高效LLM预训练中模型增长的深入探究
计算与语言
2024-10-23 v2 人工智能
摘要
由于规模庞大,LLM的预训练在计算上非常昂贵。模型增长作为一种有前景的方法出现,通过利用较小的模型来加速较大模型的训练。然而,这些模型增长方法在高效LLM预训练中的可行性仍未得到充分探索。本工作识别了三个关键障碍:(O1)缺乏全面评估,(O2)可扩展性未经测试,(O3)缺乏经验指导。为了解决O1,我们将现有方法总结为四个原子增长算子,并在标准化的LLM预训练设置中系统地评估它们。我们的发现表明,一种称为的深度堆叠算子在训练中表现出显著的加速,导致损失降低,并在八个标准NLP基准测试中相比强基线获得了整体性能提升。受这些有希望的结果的启发,我们进行了大量实验以更深入地研究,以解决O2和O3。对于O2(未经测试的可扩展性),我们的研究表明是可扩展的,并且表现一致,实验涉及增长后的7B LLM以及使用750B token预训练的LLM。例如,与使用300B token常规训练的7B模型相比,我们的模型使用194B token收敛到相同的损失,实现了54.6%的加速。我们进一步通过形式化确定的增长时机和增长因子的指导方针来解决O3(缺乏经验指导),使其在通用LLM预训练中实用。我们还提供了的深入讨论和全面的消融研究。我们的代码和预训练模型可在https://llm-stacking.github.io获取。
引用
@article{arxiv.2405.15319,
title = {Stacking Your Transformers: A Closer Look at Model Growth for Efficient LLM Pre-Training},
author = {Wenyu Du and Tongxu Luo and Zihan Qiu and Zeyu Huang and Yikang Shen and Reynold Cheng and Yike Guo and Jie Fu},
journal= {arXiv preprint arXiv:2405.15319},
year = {2024}
}
备注
NeurIPS 2024 Spotlight