X-Factor: 质量是数据集的内在属性
机器学习
2025-06-05 v2
摘要
在优化机器学习分类器的普遍探索中,三个因素——模型架构、数据集大小和类别平衡——已被证明会影响测试时的性能,但并不能完全解释它。此前有证据表明存在一个可被称为数据集质量的额外因素,但目前尚不清楚这究竟是数据集与模型架构的联合属性,还是数据集本身的内在属性。如果质量确实是数据集内在的,且独立于模型架构、数据集大小和类别平衡,那么无论这些其他因素如何,相同的数据集应该表现得更好(或更差)。为了检验这一假设,我们在此创建了数千个数据集,每个数据集都控制了大小和类别平衡,并用它们训练了具有广泛架构的分类器,从随机森林和支持向量机到深度网络。我们发现,跨架构的分类器性能在子集层面上表现出强相关性(),这支持了质量是数据集的内在属性,且独立于数据集大小、类别平衡和模型架构。深入研究发现,数据集质量似乎是某种更基本事物的涌现属性:数据集组成类别的质量。因此,质量与大小、类别平衡和模型架构一样,是性能的独立相关因素,也是优化基于机器学习的分类的独立目标。
引用
@article{arxiv.2505.22813,
title = {X-Factor: Quality Is a Dataset-Intrinsic Property},
author = {Josiah Couch and Miao Li and Rima Arnaout and Ramy Arnaout},
journal= {arXiv preprint arXiv:2505.22813},
year = {2025}
}
备注
13 pages, 7 figures