中文

Zyda-2:一个5万亿Token的高质量数据集

计算与语言 2024-11-12 v1 人工智能

摘要

本技术报告介绍了Zyda-2:一个用于语言模型预训练的五万亿Token数据集。Zyda-2被用于训练我们的Zamba2系列模型,这些模型在其参数量级上达到了SOTA。我们通过收集高质量开源Token(如FineWeb和DCLM),再经跨数据集去重和基于模型的 质量筛选,提炼出最高质量的子集来构建Zyda-2。Zyda-2在宽松的开源许可证下发布,可在 https://huggingface.co/datasets/Zyphra/Zyda-2 获取。

关键词

引用

@article{arxiv.2411.06068,
  title  = {Zyda-2: a 5 Trillion Token High-Quality Dataset},
  author = {Yury Tokpanov and Paolo Glorioso and Quentin Anthony and Beren Millidge},
  journal= {arXiv preprint arXiv:2411.06068},
  year   = {2024}
}

备注

initial upload 11/08/24