中文

SlimPajama-DC:理解大语言模型训练中的数据组合

计算与语言 2024-05-10 v3 人工智能

摘要

本文旨在利用 SlimPajama 理解各种数据组合(如网络文本、维基百科、GitHub、书籍)对大语言模型(LLM)预训练的影响。SlimPajama 是一个经过严格去重、多来源的数据集,由 Together 贡献的 1.2T token 的 RedPajama 数据集精炼并进一步去重至 627B token 而来。我们将我们的研究称为 SlimPajama-DC,这是一项经验性分析,旨在揭示在训练大语言模型中使用 SlimPajama 的基本特征和最佳实践。在我们使用 SlimPajama 的研究过程中,出现了两个关键观察:(1)全局去重与局部去重。我们分析并讨论了全局(跨不同来源的数据集)和局部(单一来源数据集内)去重如何影响训练模型的性能。(2)组合中高度去重的多来源数据集的比例。为此,我们在 SlimPajama 数据集上构建了六种配置,并使用带有 Alibi 和 SwiGLU 的 1.3B Cerebras-GPT 模型分别进行训练。我们的最佳配置在使用相同数量训练 token 的情况下,显著优于在 RedPajama 上训练的 1.3B 模型。我们所有的 1.3B 模型均在 Cerebras 16×CS-2 集群上以 bf16 混合精度训练,总算力为 80 PFLOP/s。我们进一步将我们的发现(例如全局去重后增加数据多样性至关重要)扩展到一个采用大批量训练的 7B 模型上。我们的 SlimPajama-DC 模型可在 https://huggingface.co/MBZUAI-LLM/SlimPajama-DC 获取,独立的 SlimPajama-DC 数据集可在 https://huggingface.co/datasets/MBZUAI-LLM/SlimPajama-627B-DC 获取。

关键词

引用

@article{arxiv.2309.10818,
  title  = {SlimPajama-DC: Understanding Data Combinations for LLM Training},
  author = {Zhiqiang Shen and Tianhua Tao and Liqun Ma and Willie Neiswanger and Zhengzhong Liu and Hongyi Wang and Bowen Tan and Joel Hestness and Natalia Vassilieva and Daria Soboleva and Eric Xing},
  journal= {arXiv preprint arXiv:2309.10818},
  year   = {2024}
}

备注

Technical report. Models at: https://huggingface.co/MBZUAI-LLM/SlimPajama-DC and dataset at: https://huggingface.co/datasets/MBZUAI-LLM/SlimPajama-627B-DC