中文

数据过滤的苦涩教训

机器学习 2026-05-20 v1 人工智能

摘要

我们通过新的扩张研究来探索大规模模型预训练中的数据过滤,聚焦于高计算、数据稀缺的 regime。尽管常见观点认为筛选数据以仅包含高质量信息是必需的,但我们的实验表明,在足够的计算资源下,最佳数据过滤器即无数据过滤器。我们发现,足够训练的大参数模型不仅能容忍低质量和干扰数据,甚至能从名义上“poor”的数据中获益。

关键词

引用

@article{arxiv.2605.19407,
  title  = {A Bitter Lesson for Data Filtering},
  author = {Christopher Mohri and John Duchi and Tatsunori Hashimoto},
  journal= {arXiv preprint arXiv:2605.19407},
  year   = {2026}
}