基于背景图像的弱监督定位
计算机视觉与模式识别
2019-09-12 v3
摘要
弱监督目标定位(WSOL)方法通常依赖全卷积网络以获得目标标签的类激活图(CAMs)。然而,这些网络总是突出最具判别力的部分来完成任务,定位区域远小于完整目标对象。本文提出一种新颖的端到端模型,以扩大从分类模型生成的CAMs,从而更精确地定位目标对象。具体而言,我们在传统分类网络中增加一个额外模块,从图像中提取前景目标候选区域而不将其分类为特定类别。随后我们将这些归一化区域作为无约束的像素级掩码监督用于后续分类任务。我们从互联网收集了一组定义为背景图像集的图像,其数量远小于目标数据集,但令人惊讶地很好地支持了从不同图片中提取前景区域的方法。所提取的区域独立于分类任务,其中每幅图像中提取的区域覆盖几乎整个对象而非仅显著部分。因此,这些区域可作为掩码监督分类模型生成的响应图变得更大且更精确。该方法在CUB-200-2011上以Top-1和Top-5定位误差取得了最先进结果,同时在ILSVRC2016上与其他方法相比具有竞争力。
引用
@article{arxiv.1909.03619,
title = {Weakly Supervised Localization Using Background Images},
author = {Ziyi Kou and Wentian Zhao and Guofeng Cui and Shaojie Wang},
journal= {arXiv preprint arXiv:1909.03619},
year = {2019}
}
备注
Course project of CSC577, University of Rochester