FineWeb2:统一流水线以扩展所有语言——将预训练数据处理适配至每种语言
计算与语言
2025-06-27 v1
摘要
预训练最先进的大语言模型(LLM)需要海量干净且多样的文本数据。尽管大型高质量英文预训练数据集的开放开发近期取得显著进展,但训练高性能多语言 LLM 仍具挑战,主要原因是将过滤与去重流水线适配至大量语言存在固有困难。在本工作中,我们引入基于 FineWeb 的新预训练数据集构建流水线,可自动适配以支持任意语言。我们在九种多样语言上对流水线设计选择进行广泛消融,由通过基于可测标准的新颖选择过程选取的一组有意义且信息丰富的评估任务指导。最终,我们表明该流水线可用于创建非英语语料库,其训练出的模型性能优于以往数据集。此外,我们引入一种兼顾去重计数与质量的直接且原则性的数据集再平衡方法,提供额外性能提升。最后,我们将流水线扩展至超 1000 种语言,使用近 100 个 Common Crawl 快照生成 FineWeb2,这是一个 20 TB(50 亿文档)的多语言数据集,我们将其与流水线、训练及评估代码库一同发布。
引用
@article{arxiv.2506.20920,
title = {FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language},
author = {Guilherme Penedo and Hynek Kydlíček and Vinko Sabolčec and Bettina Messmer and Negar Foroutan and Amir Hossein Kargaran and Colin Raffel and Martin Jaggi and Leandro Von Werra and Thomas Wolf},
journal= {arXiv preprint arXiv:2506.20920},
year = {2025}
}