基于知识引导消歧的多分辨率CNN大规模场景分类
摘要
卷积神经网络(CNN)在场景识别上取得了显著进展,部分得益于近期的大规模场景数据集,如Places和Places2。场景类别通常由多层次信息定义,包括局部物体、全局布局和背景环境,从而导致较大的类内差异。此外,随着场景类别数量的增加,标签歧义已成为大规模分类中的另一个关键问题。本文聚焦于大规模场景识别,并做出两项主要贡献以应对这些问题。首先,我们提出了一种多分辨率CNN架构,可在多个层次上捕获视觉内容和结构。该多分辨率CNN由粗分辨率CNN和细分辨率CNN组成,二者相互补充。其次,我们设计了两种知识引导的消歧技术来处理标签歧义问题。(i) 我们利用在验证数据上计算的混淆矩阵中的知识,将歧义类别合并为一个超类别。(ii) 我们利用额外网络的知识为每张图像生成一个软标签。然后,这些超类别或软标签被用于指导在Places2上的CNN训练。我们在三个大规模图像数据集(ImageNet、Places和Places2)上进行了大量实验,证明了我们方法的有效性。此外,我们的方法参加了两个主要的场景识别挑战赛,在ILSVRC 2015的Places2挑战赛中获得第二名,在CVPR 2016的LSUN挑战赛中获得第一名。最后,我们直接在其他场景基准上测试了学习到的表示,并在MIT Indoor67(86.7%)和SUN397(72.0%)上获得了新的最优结果。我们在~\url{https://github.com/wanglimin/MRCNN-Scene-Recognition} 发布了代码和模型。
引用
@article{arxiv.1610.01119,
title = {Knowledge Guided Disambiguation for Large-Scale Scene Classification with Multi-Resolution CNNs},
author = {Limin Wang and Sheng Guo and Weilin Huang and Yuanjun Xiong and Yu Qiao},
journal= {arXiv preprint arXiv:1610.01119},
year = {2017}
}
备注
To appear in IEEE Transactions on Image Processing. Code and models are available at https://github.com/wanglimin/MRCNN-Scene-Recognition