中文

为何有时“少即是多”:数据精选的理论

机器学习 2025-11-06 v1 机器学习

摘要

本文引入了一套理论框架,以解决现代机器学习中的核心悖论:何时应该使用更少的数据?这个问题日益关键,因为经典的规模定律暗示“更多即是更多”(Sun等人,2025),但LIMO(“更少即是更好”)和s1(Ye等人,2025;Muenighoff等人,2025)等方法通过小型积极精选的数据集实现了更好的性能。本文研究数据精选策略,其中不完美的oracle根据难度和正确性选择训练示例。我们的结果提供了在标签无关和标签相关的精选规则下,对测试误差的精确规模曲线,揭示了何时以及为何仅保留数据子集可以改善泛化。在与经典规模定律相反,我们表明在特定条件下,小型精选数据集可以超过完整数据集,并通过推导与数据规模和质量相关的精确相位转换曲线,给出实现这一点的分析条件。我们用ImageNet上的实证结果验证了这些理论主张,确认了关于何时何地进行精选可提高准确率,甚至可以缓解模型崩溃的预测。此外,我们的框架为LLM数学推理中最近观察到的矛盾精选策略提供了原则性解释。

关键词

引用

@article{arxiv.2511.03492,
  title  = {Why Less is More (Sometimes): A Theory of Data Curation},
  author = {Elvis Dohmatob and Mohammad Pezeshki and Reyhane Askari-Hemmat},
  journal= {arXiv preprint arXiv:2511.03492},
  year   = {2025}
}