真实世界视觉数据集中自动误标检测的实证研究
计算机视觉与模式识别
2023-12-06 v1 人工智能
应用统计
摘要
计算机视觉的重大进展主要归功于带标签数据集的使用。然而,为数据集获取标签通常会导致错误,这会损害模型性能。近期的工作提出了自动识别误标图像的方法,但探索如何在实际数据集中有效实施这些策略的研究仍然很少。为了改进以数据为中心的真实世界视觉数据集清洗方法,我们首先进行了 200 多项实验,在各种合成和真实噪声设置以及不同噪声水平下,仔细地对最近开发的自动误标检测方法在多个数据集上进行了基准测试。我们将这些方法与我们精心设计的简单高效误标检测器(SEMD)进行比较,发现 SEMD 的性能与先前的误标检测方法相当或更优。然后,我们将 SEMD 应用于多个真实世界计算机视觉数据集,并测试在清洗后的数据上重新训练后,数据集大小、误标移除策略和误标移除量如何进一步影响模型性能。通过对该方法的精心设计,我们发现,在较小数据量场景下,误标移除可使重训练分类器的每类性能提升高达 8%。
引用
@article{arxiv.2312.02200,
title = {An Empirical Study of Automated Mislabel Detection in Real World Vision Datasets},
author = {Maya Srikanth and Jeremy Irvin and Brian Wesley Hill and Felipe Godoy and Ishan Sabane and Andrew Y. Ng},
journal= {arXiv preprint arXiv:2312.02200},
year = {2023}
}