中文

1.7B LLaMa 模型的训练动态:一种数据高效的方法

计算与语言 2025-04-08 v3 人工智能

摘要

预训练大型语言模型是一项受多种因素影响的复杂工作,这些因素包括模型架构、数据质量、训练连续性以及硬件限制。在本文中,我们分享了训练 DMaS-LLaMa-Lite 的经验与见解,这是一个完全开源、基于 LLaMa、具有 17 亿参数的模型,使用了约 200 亿个精心筛选的数据 token 进行训练。我们记录了完整的训练轨迹,记录了不断演变的验证损失水平和下游基准如何反映出从无连贯性文本到流畅且具上下文基础的输出的转变。除预训练外,我们还将分析扩展至专注于指令微调的训练后阶段,在此阶段模型被优化以产生更具上下文适宜性、更符合用户对齐的响应。我们强调了实际操作中的考量,例如从检查点恢复时恢复优化器状态的重要性,以及硬件变化对训练稳定性和吞吐量的影响。虽然定性评估提供了对模型改进的直观理解,但我们的分析还扩展至各种性能基准,展示了高质量数据和合理的缩放如何使模型在训练 token 显著更少的情况下取得具竞争力的结果。通过详细描述这些经验并提供训练日志、检查点和样本输出,我们旨在指导未来的研究人员和从业者完善其预训练策略。训练脚本可在 Github 上获取:https://github.com/McGill-DMaS/DMaS-LLaMa-Lite-Training-Code。模型检查点可在 Huggingface 上获取:https://huggingface.co/collections/McGill-DMaS/dmas-llama-lite-6761d97ba903f82341954ceb。

关键词

引用

@article{arxiv.2412.13335,
  title  = {Training Dynamics of a 1.7B LLaMa Model: A Data-Efficient Approach},
  author = {Miles Q. Li and Benjamin C. M. Fung and Shih-Chia Huang},
  journal= {arXiv preprint arXiv:2412.13335},
  year   = {2025}
}