中文

精准检测并非唯一所需:在网页噪声数据集中对标签噪声的有效方法

计算机视觉与模式识别 2024-07-09 v1

摘要

在网页爬取的数据上训练分类器需要学习对注解错误和无关示例具有鲁棒性的算法。本文建立在最近的经验观察基础上:将无监督对比学习应用于噪声网页数据集会得到一种在 which 下,类内分布 (ID) 和类外分布 (OOD) 样本在线性可分的特征表示下。我们表明,直接估计分离超平面确实能够提供对 OOD 样本的准确检测,但令人惊讶的是,这种检测并未转化为分类准确率的提升。深入研究这一现象后,我们发现,近乳完美的检测忽略了一类干净的示例,这些示例对监督学习至为重要。这些示例通常代表视觉上简单的图像,尽管使用无监督学习方法与 OOD 分布不易分离,但使用标准的损失或距离基于的方法仍能较易地识别为干净的示例。由于我们进一步观察到与 SOTA 指标之间存在较低的相关性,这促使我们提出一种混合解决方案,交替使用基于线性分离的噪声检测和基于小损失的方法。当与 SOTA 算法 PLS 结合时,我们在存在网页噪声的情况下,显著改进了真实世界图像分类的 SOTA 结果。

关键词

引用

@article{arxiv.2407.05528,
  title  = {An accurate detection is not all you need to combat label noise in web-noisy datasets},
  author = {Paul Albert and Jack Valmadre and Eric Arazo and Tarun Krishna and Noel E. O'Connor and Kevin McGuinness},
  journal= {arXiv preprint arXiv:2407.05528},
  year   = {2024}
}

备注

Accepted in the European Conference on Computer Vision (ECCV) 2024