中文

利用最小监督从噪声大规模数据集中学习

计算机视觉与模式识别 2017-04-11 v2

摘要

我们提出了一种方法,能够有效利用带有噪声标注的数百万张图像,并结合一小部分干净标注的图像,来学习强大的图像表示。结合干净数据和噪声数据的一种常见方法是首先使用大型噪声数据集预训练网络,然后用干净数据集进行微调。我们表明这种方法未能充分利用干净集中包含的信息。因此,我们展示了如何利用干净标注在微调网络之前减少大型数据集中的噪声,微调时使用干净集和去噪后的全集。该方法包含一个多任务网络,联合学习清理噪声标注和准确分类图像。我们在最近发布的 Open Images 数据集上评估了我们的方法,该数据集包含约 900 万张图像、每张图像多个标注以及超过 6000 个独特类别。对于小规模干净标注集,我们使用了验证集的四分之一,约 4 万张图像。我们的结果表明,所提出的方法在 Open Images 数据集的所有主要类别上均明显优于直接微调。此外,我们的方法对于大量具有广泛标注噪声(20-80% 假阳性标注)的类别特别有效。

关键词

引用

@article{arxiv.1701.01619,
  title  = {Learning From Noisy Large-Scale Datasets With Minimal Supervision},
  author = {Andreas Veit and Neil Alldrin and Gal Chechik and Ivan Krasin and Abhinav Gupta and Serge Belongie},
  journal= {arXiv preprint arXiv:1701.01619},
  year   = {2017}
}

备注

CVPR 2017