中文

Zyda:一个1.3万亿 token的开放语言模型数据集

计算与语言 2024-09-05 v2 人工智能

摘要

大型语言模型(LLM)的规模在近年来呈指数级增长,其计算和数据需求也随之激增。即使在相对较小的规模下,领先的语言模型也通常需要在至少一万亿个标记上进行训练。这种快速的发展掩盖了用于大规模LLM预训练的开源数据集的增长。在本文中,我们介绍了Zyda(Zyphra 数据集),一个包含1.3万亿标记的数据集,采用宽松许可证,集成了多个主要受信任的开源数据集为单一高质量语料库。我们应用严格的过滤和去重过程,既在单个数据集内部,也在跨数据集之间,以保持和提高源数据集所继承的质量。我们的评估显示,Zyda不仅在其他开源数据集如 Dolma、FineWeb 和 RefinedWeb 方面表现优异,而且在来自 Pythia 系列的可比模型上显著提升了性能。我们严格的数据处理方法显著增强了Zyda的效果,甚至在各自独立使用时也优于其最佳组成数据集。

关键词

引用

@article{arxiv.2406.01981,
  title  = {Zyda: A 1.3T Dataset for Open Language Modeling},
  author = {Yury Tokpanov and Beren Millidge and Paolo Glorioso and Jonathan Pilault and Adam Ibrahim and James Whittington and Quentin Anthony},
  journal= {arXiv preprint arXiv:2406.01981},
  year   = {2024}
}