看穿人类报告偏差:基于噪声人类中心标签的视觉分类器
计算机视觉与模式识别
2016-04-13 v2
摘要
当人类标注者被给予关于图像中标注什么的选择时,他们应用自身的主观判断来决定忽略什么和提及什么。我们将这些噪声的“以人为中心”标注称为表现出人类报告偏差。此类标注的例子包括照片分享网站上的图像标签和关键词,或包含图像描述的数据集。本文中,我们利用这些噪声标注学习视觉正确的图像分类器。此类标注不使用一致词汇表,且遗漏了图像中大量信息;然而,我们证明这些标注中的噪声表现出结构并可被建模。我们提出一种算法将人类报告偏差与正确的视觉基础标签解耦。我们的结果对于报告“图像中有什么”与“值得说什么”高度可解释。我们沿多种度量和数据集(包括MS COCO和Yahoo Flickr 100M)展示了算法的效能。我们显示了相对于传统算法在图像分类和图像描述上的显著改进,在某些情况下使现有方法性能翻倍。
引用
@article{arxiv.1512.06974,
title = {Seeing through the Human Reporting Bias: Visual Classifiers from Noisy Human-Centric Labels},
author = {Ishan Misra and C. Lawrence Zitnick and Margaret Mitchell and Ross Girshick},
journal= {arXiv preprint arXiv:1512.06974},
year = {2016}
}
备注
To appear in CVPR 2016