RedPajama:用于训练大型语言模型的开源数据集
计算与语言
2024-11-20 v1 机器学习
摘要
大型语言模型正日益成为人工智能、科学乃至整个社会的基石技术,然而数据集构成与过滤的最佳策略在很大程度上仍不明确。许多性能顶尖的模型在其数据集构建和模型开发过程中缺乏透明度,这为完全开源语言模型的发展构成了障碍。在本文中,我们指出了推进开源语言模型必须解决的三个与数据相关的核心挑战。这些挑战包括:(1)模型开发(包括数据构建过程)的透明度,(2)获取大量高质量数据,以及(3)用于数据集构建与分析的产物和元数据的可用性。为了应对这些挑战,我们发布了 RedPajama-V1,这是 LLaMA 训练数据集的开源复现版本。此外,我们还发布了 RedPajama-V2,这是一个仅包含网页内容的大规模数据集,由原始、未过滤的文本数据以及质量信号和元数据组成。RedPajama 数据集总计包含超过 100 万亿个 token,跨越多个领域,其质量信号有助于数据过滤,旨在激发众多新数据集的开发。迄今为止,这些数据集已被用于训练生产中使用的强大语言模型,如 Snowflake Arctic、Salesforce 的 XGen 和 AI2 的 OLMo。为了深入了解 RedPajama 的质量,我们使用参数量高达 1.6B 的纯解码器语言模型进行了一系列分析和消融研究。我们的发现展示了如何有效利用网页数据的质量信号来构建高质量的数据集子集,凸显了 RedPajama 在推进大规模透明且高性能语言模型开发方面的潜力。
引用
@article{arxiv.2411.12372,
title = {RedPajama: an Open Dataset for Training Large Language Models},
author = {Maurice Weber and Daniel Fu and Quentin Anthony and Yonatan Oren and Shane Adams and Anton Alexandrov and Xiaozhong Lyu and Huu Nguyen and Xiaozhe Yao and Virginia Adams and Ben Athiwaratkun and Rahul Chalamala and Kezhen Chen and Max Ryabinin and Tri Dao and Percy Liang and Christopher Ré and Irina Rish and Ce Zhang},
journal= {arXiv preprint arXiv:2411.12372},
year = {2024}
}
备注
38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks