基于元数据的网络监督图像分类:通过视觉-语义图实现自动噪声标签校正
计算机视觉与模式识别
2020-10-13 v1
摘要
网络监督学习近期因其无需昂贵人工标注即可高效扩展数据而颇具吸引力。然而,采用搜索查询或标签作为图像的网络标签进行训练会带来大量噪声,从而降低深度神经网络(DNN)的性能。特别是,由于查询词的语义混淆,由一个查询检索到的图像可能包含大量属于其他概念的图像。例如,在 Flickr 上搜索 `tiger cat' 会返回占多数的老虎图像而非猫图像。这些真实的噪声样本通常在视觉空间中具有清晰的视觉语义簇,会误导 DNN 学习准确的语义标签。为纠正现实世界中的噪声标签,昂贵的人工标注似乎不可或缺。幸运的是,我们发现元数据可提供额外知识,以无人工方式发现干净的网络标签,使得在海量含噪标签的网络数据中自动提供正确语义引导成为可能。在本文中,我们提出了一种基于视觉-语义图的自动标签校正器 VSGraph-LC。VSGraph-LC 从参考元数据与正确标签概念间语义相似度的锚点选择开始,随后使用图神经网络(GNN)在视觉图上从锚点传播正确标签。在真实网络监督学习数据集 Webvision-1000 和 NUS-81-Web 上的实验显示了 VSGraph-LC 的有效性与鲁棒性。此外,VSGraph-LC 在开集验证集上展现了其优势。
引用
@article{arxiv.2010.05864,
title = {Webly Supervised Image Classification with Metadata: Automatic Noisy Label Correction via Visual-Semantic Graph},
author = {Jingkang Yang and Weirong Chen and Litong Feng and Xiaopeng Yan and Huabin Zheng and Wayne Zhang},
journal= {arXiv preprint arXiv:2010.05864},
year = {2020}
}
备注
Accepted to ACM Multimedia 2020 (Oral)