重访连续预训练中的回放与梯度对齐:大型语言模型的实践
机器学习
2025-08-05 v1 人工智能
计算与语言
摘要
大型语言模型(LLMs)的训练通常涉及在大型语料库上进行预训练,仅当新数据可用时才会完全重新启动整个过程。更有效且更节省资源的方法是连续预训练,即通过更新新数据来更新模型,而不是从头重新训练。在本文中,我们深入审视了两种在连续学习文献中流行的解决此分布迁移问题的方案:经验回放和梯度对齐。我们在Llama家族架构中进行大规模连续预训练,跨语言使用1000亿token的训练数据,发现经验回放和梯度对齐都导致学习更稳定且不会遗忘。这种结论在我们变化模型规模和任务数量与多样性时都成立。此外,我们首次在LLM预训练语境中展示了梯度对齐技术的有效性,并提出了一种高效的meta-experience replay(MER)实现,使经验回放能够获得梯度对齐的益处,同时几乎没有计算和内存开销。我们的规模分析表明,回放旧示例的小比率显然比投资于模型规模更有价值,但投资于高回放率比投资于模型规模更节省计算资源。
引用
@article{arxiv.2508.01908,
title = {Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models},
author = {Istabrak Abbes and Gopeshh Subbaraj and Matthew Riemer and Nizar Islah and Benjamin Therien and Tsuguchika Tabaru and Hiroaki Kingetsu and Sarath Chandar and Irina Rish},
journal= {arXiv preprint arXiv:2508.01908},
year = {2025}
}