最大化数据潜力:两阶段预训练提升LLM准确性
计算与语言
2024-12-23 v1 人工智能
机器学习
摘要
有效地对大语言模型进行预训练需要战略性的数据选择、混合和排序。然而,由于模型开发者有限披露数据混合的关键细节,尤其是其对更长标记视野和更大模型规模的可扩展性,仍存许多未知。为此,我们形式化了两阶段预训练的概念,系统性地研究了如何选择和混合数据以最大化两个阶段的模型准确性。我们的发现表明,两阶段方法在随机数据排序和自然标记分布下平均准确性提升了 3.4% 和 17%。我们深入指导如何根据数据源的质量和要看到的 epoch 数来设计最佳混合方案。我们提议使用在 1T token 规模较小的 downsampled 数据设计混合方案,并演示了该方法有效扩展至 15T token 较长视野和 25B 模型规模。这些见解为实践者提供了一系列可遵循的步骤,以设计和扩展数据混合方案。
引用
@article{arxiv.2412.15285,
title = {Maximize Your Data's Potential: Enhancing LLM Accuracy with Two-Phase Pretraining},
author = {Steven Feng and Shrimai Prabhumoye and Kezhi Kong and Dan Su and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2412.15285},
year = {2024}
}