中文

测试集中普遍存在的标注错误破坏机器学习基准的稳定性

机器学习 2021-11-09 v4 人工智能 机器学习

摘要

我们在 10 个最常用的计算机视觉、自然语言与音频数据集中识别出测试集的标注错误,并进而研究这些标注错误影响基准结果的潜在可能。测试集中的错误数量众多且分布广泛:我们估计这 10 个数据集平均至少有 3.3% 的错误,例如 ImageNet 验证集中标注错误至少占 6%。使用置信学习(confident learning)算法识别疑似标注错误,然后通过众包进行人工验证(平均而言,跨数据集算法标记的候选中有 51% 确实被错误标注)。传统上,机器学习从业者基于测试准确率选择部署的模型——我们的发现对此提出警示,建议在对正确标注的测试集上评判模型可能更有用,尤其是对于噪声现实世界数据集。令人惊讶的是,我们发现对于错误标注数据占高比例的现实世界数据集,低容量模型可能比高容量模型更具实际用处。例如,在修正标签的 ImageNet 上:若原始误标测试样本的比例仅增加 6%,ResNet-18 便优于 ResNet-50。在修正标签的 CIFAR-10 上:若原始误标测试样本的比例仅增加 5%,VGG-11 便优于 VGG-19。这 10 个数据集的测试集错误可于 https://labelerrors.com 查看,所有标注错误可由 https://github.com/cleanlab/label-errors 复现。

关键词

引用

@article{arxiv.2103.14749,
  title  = {Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks},
  author = {Curtis G. Northcutt and Anish Athalye and Jonas Mueller},
  journal= {arXiv preprint arXiv:2103.14749},
  year   = {2021}
}

备注

Demo available at https://labelerrors.com/ and source code available at https://github.com/cleanlab/label-errors