Nemotron-CC:将 Common Crawl 转化为精炼的长期预训练数据集
计算与语言
2025-06-03 v2
摘要
最近的英语 Common Crawl 数据集,如 FineWeb-Edu 和 DCLM,通过激进的模型过滤方法实现了显著的基准提升,但以牺牲 90% 数据为代价。这限制了其在如 15T tokens 级别的 Llama 3.1 等长序列预训练任务中的适用性。本文展示了如何通过结合分类器集成、合成数据重述和减少对启发式过滤器的依赖,实现更好的准确率与数据量之间的权衡。在训练 8B 参数模型达到 1T tokens 时,我们的数据集的高质量子集相较于 DCLM 在 MMLU 上提升 5.6 分,证明了此方法在相对较短的 token 序列长度上提升准确率的有效性。进一步地,我们的完整 6.3T token 数据集在 MMLU 上与 DCLM 持平,但包含 DCLM 的四倍独特真实 token。这一突破实现了在长序列长度上的最先进训练:一个在 15T tokens 上训练的 8B 参数模型,其中 7.2T tokens 来自我们的数据集,其表现优于 Llama 3.1 8B 模型:MMLU 提升 5 分,ARC-Challenge 提升 3.1 分,在十个多样化任务上的平均提升 0.5 分。该数据集可在 https://data.commoncrawl.org/contrib/Nemotron/Nemotron-CC/index.html 获取。
引用
@article{arxiv.2412.02595,
title = {Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset},
author = {Dan Su and Kezhi Kong and Ying Lin and Joseph Jennings and Brandon Norick and Markus Kliegl and Mostofa Patwary and Mohammad Shoeybi and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2412.02595},
year = {2025}
}
备注
ACL 2025