弱监督PatchNet:描述与聚合局部图像块用于场景识别
计算机视觉与模式识别
2017-04-26 v2
摘要
传统的基于局部描述符(如SIFT)的特征编码方案(如Fisher向量)与近期的卷积神经网络(CNN)是两类成功的图像识别方法。本文提出一种混合表示,它利用CNN的判别能力和描述符编码方案的简洁性进行图像识别,重点关注场景识别。为此,我们从以下方面做出三项主要贡献。第一,我们提出了一种图像块级别的端到端架构来建模局部图像块的外观,称为PatchNet。PatchNet本质上是一个以弱监督方式训练的定制网络,利用图像级监督来指导图像块级特征提取。第二,我们提出一种称为VSAD的混合视觉表示,利用PatchNet的鲁棒特征表示来描述局部图像块,并利用PatchNet的语义概率将这些局部图像块聚合为全局表示。第三,基于所提出的VSAD表示,我们提出了一种新的领先的场景识别方法,在两个标准基准数据集上取得了优异性能:MIT Indoor67(86.2%)和SUN397(73.0%)。
引用
@article{arxiv.1609.00153,
title = {Weakly Supervised PatchNets: Describing and Aggregating Local Patches for Scene Recognition},
author = {Zhe Wang and Limin Wang and Yali Wang and Bowen Zhang and Yu Qiao},
journal= {arXiv preprint arXiv:1609.00153},
year = {2017}
}
备注
To appear in IEEE Transactions on Image Processing. Code and model available at https://github.com/wangzheallen/vsad