FineWeb数据集:从网络中精选最优质的大规模文本数据
计算与语言
2024-11-01 v2
摘要
大型语言模型(LLM)的性能在很大程度上取决于其预训练数据集的质量和规模。然而,像Llama 3和Mixtral这样的最先进开源LLM的预训练数据集并未公开,并且关于它们是如何创建的知之甚少。在这项工作中,我们介绍了FineWeb,这是一个包含15万亿个token的数据集,源自96个Common Crawl快照,它能够训练出比其他开放预训练数据集性能更好的LLM。为了加深对如何最好地策划高质量预训练数据集的理解,我们详细记录并消融了FineWeb中使用的所有设计选择,包括对去重和过滤策略的深入研究。此外,我们还介绍了FineWeb-Edu,这是一个从FineWeb中过滤出的包含1.3万亿个token的教育文本集合。在FineWeb-Edu上预训练的LLM在MMLU和ARC等知识和推理密集型基准测试中表现出显著更好的性能。除了我们的数据集,我们还公开发布了我们的数据策展代码库以及我们在消融实验期间训练的所有模型。
引用
@article{arxiv.2406.17557,
title = {The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale},
author = {Guilherme Penedo and Hynek Kydlíček and Loubna Ben allal and Anton Lozhkov and Margaret Mitchell and Colin Raffel and Leandro Von Werra and Thomas Wolf},
journal= {arXiv preprint arXiv:2406.17557},
year = {2024}
}