数据过滤的苦涩教训
机器学习
2026-05-20 v1 人工智能
摘要
我们通过新的扩张研究来探索大规模模型预训练中的数据过滤,聚焦于高计算、数据稀缺的 regime。尽管常见观点认为筛选数据以仅包含高质量信息是必需的,但我们的实验表明,在足够的计算资源下,最佳数据过滤器即无数据过滤器。我们发现,足够训练的大参数模型不仅能容忍低质量和干扰数据,甚至能从名义上“poor”的数据中获益。
引用
@article{arxiv.2605.19407,
title = {A Bitter Lesson for Data Filtering},
author = {Christopher Mohri and John Duchi and Tatsunori Hashimoto},
journal= {arXiv preprint arXiv:2605.19407},
year = {2026}
}