文档是教育性的还是仅为 Wikipedia 风格?——基于分类器的质量过滤的陷阱
计算与语言
2026-05-25 v1
摘要
基于分类器的质量过滤器近期在构建预训练语料库方面发挥着基础性作用。该技术能够部署单一模型来取代或补充一组启发式方法,在诸多大型语言模型中证明其有效性。在本工作中,我们揭示了该方法的一个关键漏洞,通过演示一种简单的 Wikipedia 风格重新格式化操作如何显著改变模型的质量评估,从而使低质量内容超过过滤阈值。我们的分析表明,FineWeb-Edu CQF 模型会因页面重排而反转约 7% 受评估文档的过滤决策,从而允许进入预训练语料库的低质量内容。
引用
@article{arxiv.2605.23721,
title = {Is a Document Educational or Just Wikipedia-Style? -- Pitfalls of Classifier-Based Quality Filtering},
author = {Mateusz Klimaszewski and Piotr Andruszkiewicz},
journal= {arXiv preprint arXiv:2605.23721},
year = {2026}
}
备注
Accepted to ACL 2026