面向弱监督目标定位的多尺度判别区域发现
计算机视觉与模式识别
2019-09-25 v1
摘要
在图像中以弱监督方式定位目标是计算机视觉领域研究的一个关键问题。许多现有的弱监督目标定位(WSOL)方法通过深度卷积神经网络得到的特征图(激活图)来估计最具判别性的区域,即仅定位具有最强判别响应的目标或其部分。然而,当一幅图像包含多个同类目标或小目标时,激活图常表现出不同的局部最大响应或相对较弱的响应。本文提出一种简单而有效的多尺度判别区域发现方法,仅利用图像级类别标签,即可定位更完整的对象以及尽可能多的对象。不同于以往仅考虑最终卷积层梯度权重的方法,我们将流入CNN不同卷积层的梯度权重作为本方法的输入。为挖掘更多用于目标定位任务的判别区域,利用梯度权重图中的多个局部最大值通过并行滑动窗口生成定位图。此外,融合来自不同卷积层的多尺度定位图以产生最终结果。我们在VGGnet基础上于ILSVRC 2016、CUB-200-2011和PASCAL VOC 2012数据集上评估所提方法。在ILSVRC 2016上,该方法取得48.65%的Top-1定位误差,较先前结果提升2.75%。在PASCAL VOC 2012上,我们的方法达到0.43的最高定位精度。即使在CUB-200-2011数据集上,本方法仍取得具竞争力的结果。
引用
@article{arxiv.1909.10698,
title = {Multi-scale discriminative Region Discovery for Weakly-Supervised Object Localization},
author = {Pei Lv and Haiyu Yu and Junxiao Xue and Junjin Cheng and Lisha Cui and Bing Zhou and Mingliang Xu and Yi Yang},
journal= {arXiv preprint arXiv:1909.10698},
year = {2019}
}
备注
12 pages,7 figures