中文

用于场景识别与域适应的混合CNN与基于字典的模型

计算机视觉与模式识别 2016-02-01 v1

摘要

卷积神经网络(CNN)已在许多不同视觉任务中取得最先进的性能。从大规模训练数据集学习到的CNN特征比手工设计特征更具判别性和准确性。此外,CNN特征在不同域间也可迁移。另一方面,传统的基于字典的特征(如BoW和SPM)包含更多隐含于图像中的局部判别与结构信息。为进一步提升性能,本文提出将CNN与基于字典的模型相结合用于场景识别与视觉域适应。具体地,基于调优良好的CNN模型(如AlexNet和VGG Net),进一步构建两种基于字典的表示,即中层局部表示(MLR)与卷积Fisher向量表示(CFV)。在MLR中,采用一种高效的两阶段聚类方法,即先对单幅图像的部件进行加权空间与特征空间谱聚类,再对所有图像的各代表性部件聚类,以生成类混合或类特定的部件字典。之后,该部件字典与多尺度图像输入作用生成中层表示。在CFV中,利用多尺度且尺度比例化的GMM训练策略,基于CNN的最后卷积层生成Fisher向量。通过融合MLR、CFV与全连接层CNN特征的互补信息,可在场景识别与域适应问题上达到最先进的性能。一个有趣的发现是,我们提出的混合表示(来自在ImageNet上训练的VGG net)也与GoogLeNet和/或VGG-11(在Place205上训练)极具互补性。

关键词

引用

@article{arxiv.1601.07977,
  title  = {Hybrid CNN and Dictionary-Based Models for Scene Recognition and Domain Adaptation},
  author = {Guo-Sen Xie and Xu-Yao Zhang and Shuicheng Yan and Cheng-Lin Liu},
  journal= {arXiv preprint arXiv:1601.07977},
  year   = {2016}
}

备注

Accepted by TCSVT on Sep.2015