大型语言模型递增训练的有效性
计算与语言
2024-12-02 v1 人工智能
摘要
大型语言模型的训练是一项计算密集型过程,往往需要大量资源才能实现最先进的性能。层级递增训练被提出作为一种潜在策略,通过逐步引入网络层来优化训练过程,预期其能导致更快的收敛并更高效地利用计算资源。在本文中,我们调查了大型语言模型递增训练的有效性,将训练过程划分为多个阶段,其中逐层添加网络层。我们的实验结果表明,尽管递增方法最初显示出一些计算效率,但最终需要更大的总计算成本才能达到与传统全规模训练相当的性能。尽管递增训练过程最终可以在显著延长的持续训练后缩小与基线的性能差距,但它并不能以更高效的方式实现。这表明,层级递增训练可能不是训练大型语言模型的可行替代方案,突显了其局限性,并为理解这一方法的低效性提供了宝贵见解。
引用
@article{arxiv.2411.18700,
title = {On the Effectiveness of Incremental Training of Large Language Models},
author = {Miles Q. Li and Benjamin C. M. Fung and Shih-Chia Huang},
journal= {arXiv preprint arXiv:2411.18700},
year = {2024}
}