中文

X-Factor: 质量是数据集的内在属性

机器学习 2025-06-05 v2

摘要

在优化机器学习分类器的普遍探索中,三个因素——模型架构、数据集大小和类别平衡——已被证明会影响测试时的性能,但并不能完全解释它。此前有证据表明存在一个可被称为数据集质量的额外因素,但目前尚不清楚这究竟是数据集与模型架构的联合属性,还是数据集本身的内在属性。如果质量确实是数据集内在的,且独立于模型架构、数据集大小和类别平衡,那么无论这些其他因素如何,相同的数据集应该表现得更好(或更差)。为了检验这一假设,我们在此创建了数千个数据集,每个数据集都控制了大小和类别平衡,并用它们训练了具有广泛架构的分类器,从随机森林和支持向量机到深度网络。我们发现,跨架构的分类器性能在子集层面上表现出强相关性(R2=0.79R^2=0.79),这支持了质量是数据集的内在属性,且独立于数据集大小、类别平衡和模型架构。深入研究发现,数据集质量似乎是某种更基本事物的涌现属性:数据集组成类别的质量。因此,质量与大小、类别平衡和模型架构一样,是性能的独立相关因素,也是优化基于机器学习的分类的独立目标。

关键词

引用

@article{arxiv.2505.22813,
  title  = {X-Factor: Quality Is a Dataset-Intrinsic Property},
  author = {Josiah Couch and Miao Li and Rima Arnaout and Ramy Arnaout},
  journal= {arXiv preprint arXiv:2505.22813},
  year   = {2025}
}

备注

13 pages, 7 figures