复用,不要重新训练:语言模型持续预训练的配方
计算与语言
2024-07-11 v1
摘要
随着语言模型参数数量和预训练数据集大小的不断增长,预训练的计算成本已变得难以承受,除非是最具资源支持的团队。日益增加的成本使得在完成预训练后能够复用模型变得尤为重要,这允许模型的能力在无需从头训练的情况下进一步提升。本文详细阐述了一套指南,涵盖如何设计有效的数据分布和学习率计划以进行语言模型的持续预训练。在对一个 well-trained 的 15B 参数模型进行持续预训练时,我们展示了相对于在预训练集上进行持续训练的基线,平均模型准确率提升了 9%。 resulting 的配方为通过复用而非重新训练来开发语言模型提供了实用的起点。
引用
@article{arxiv.2407.07263,
title = {Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models},
author = {Jupinder Parmar and Sanjev Satheesh and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2407.07263},
year = {2024}
}
备注
Preprint. Under review