中文

弱监督PatchNet:描述与聚合局部图像块用于场景识别

计算机视觉与模式识别 2017-04-26 v2

摘要

传统的基于局部描述符(如SIFT)的特征编码方案(如Fisher向量)与近期的卷积神经网络(CNN)是两类成功的图像识别方法。本文提出一种混合表示,它利用CNN的判别能力和描述符编码方案的简洁性进行图像识别,重点关注场景识别。为此,我们从以下方面做出三项主要贡献。第一,我们提出了一种图像块级别的端到端架构来建模局部图像块的外观,称为PatchNet。PatchNet本质上是一个以弱监督方式训练的定制网络,利用图像级监督来指导图像块级特征提取。第二,我们提出一种称为VSAD的混合视觉表示,利用PatchNet的鲁棒特征表示来描述局部图像块,并利用PatchNet的语义概率将这些局部图像块聚合为全局表示。第三,基于所提出的VSAD表示,我们提出了一种新的领先的场景识别方法,在两个标准基准数据集上取得了优异性能:MIT Indoor67(86.2%)和SUN397(73.0%)。

关键词

引用

@article{arxiv.1609.00153,
  title  = {Weakly Supervised PatchNets: Describing and Aggregating Local Patches for Scene Recognition},
  author = {Zhe Wang and Limin Wang and Yali Wang and Bowen Zhang and Yu Qiao},
  journal= {arXiv preprint arXiv:1609.00153},
  year   = {2017}
}

备注

To appear in IEEE Transactions on Image Processing. Code and model available at https://github.com/wangzheallen/vsad