中文

数据质量幻象:重新思考基于分类器的质量过滤在大语言模型预训练中的作用

机器学习 2025-10-03 v2 计算与语言

摘要

大规模模型是在包含混合质量文档的大规模网络爬虫数据集上预训练的,因此数据过滤至关重要。一种流行的方法是基于分类器的质量过滤(CQF),即训练一个二进制分类器来区分预训练数据与小规模高质量数据集。它为每个预训练文档分配一个质量分数,定义为分类器的得分,仅保留得分最高的那些。我们对CQF进行深入分析。我们指出,尽管CQF提高了下游任务性能,但并不必然增强在高质量数据集上的语言建模。我们通过解释CQF实际上也隐式地过滤了高质量数据集来解释这一悖论。我们进一步比较了使用CQF训练的模型与通过随机标记置换获得的质量逐渐提升的合成数据的模型行为,发现两者呈现截然不同的趋势。我们的结果挑战了CQF捕捉有意义数据质量概念的观点。

关键词

引用

@article{arxiv.2510.00866,
  title  = {The Data-Quality Illusion: Rethinking Classifier-Based Quality Filtering for LLM Pretraining},
  author = {Thiziri Nait Saada and Louis Bethune and Michal Klein and David Grangier and Marco Cuturi and Pierre Ablin},
  journal= {arXiv preprint arXiv:2510.00866},
  year   = {2025}
}

备注

21 pages, 20 figures, 2 tables, preprint