Blu-WERP (网页提取与精炼流水线): 一种用于预处理大语言模型数据集的可扩展流水线
计算与语言
2025-12-04 v1 机器学习
摘要
高质量的训练数据是大语言模型性能的基础,然而现有的预处理流水线通常难以有效去除网络规模语料库中的噪声和非结构化内容。本文介绍了Blu-WERP,一种新颖的数据预处理流水线,旨在优化用于大语言模型训练的Common Crawl WARC文件质量。我们证明,在多个模型规模和评估基准上,Blu-WERP显著优于包括DCLM在内的已建立基线。我们的流水线处理CC WARC转储,实现了先进的过滤和质量评估机制。我们使用1.5亿、4亿、5.3亿、7.5亿和10亿参数的模型进行了全面评估,针对九个标准基准进行了测试,这些基准分为世界知识与推理、语言理解和常识推理。结果显示,Blu-WERP在所有模型规模上均持续取得优越性能。在10亿参数规模上,相对于DCLM和Fineweb,Blu-WERP分别实现了4.0%和9.5%的总体改进,同时实现了每token质量效率的提升。分类分析显示,在世界知识与推理方面改进2.4%,在语言理解方面改进6.2%,在常识推理方面改进4.2%。这些结果确立了Blu-WERP作为最先进的预处理流水线的地位,它以降低的计算成本显著提高了大语言模型的训练数据质量和下游模型性能。我们的发现为日益增长的数据中心AI研究做出了贡献,证明了预处理流水线设计显著影响大语言模型的能力。Blu-WERP流水线代表了数据质量优化的实际进步,为研究人员和从业者提供了一种提高大语言模型训练效率和模型性能的有效解决方案。
引用
@article{arxiv.2511.18054,
title = {Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large Language Model Datasets},
author = {Gowtham and Sai Rupesh and Sanjay Kumar and Saravanan and Venkata Chaithanya},
journal= {arXiv preprint arXiv:2511.18054},
year = {2025}
}