中文

当 CNN 遇上随机 RNN:面向 RGB-D 物体与场景识别的多层次分析

计算机视觉与模式识别 2022-01-12 v2

摘要

物体与场景识别是图像理解中两项具挑战性但至关重要的任务。特别是,RGB-D 传感器在处理这些任务中的使用已成为实现更好视觉理解的重要焦点领域。与此同时,深度神经网络,尤其是卷积神经网络(CNNs),已广泛普及,并通过以有效深度特征替代手工特征而应用于众多视觉任务。然而,如何有效地从多层 CNN 模型中提取深度特征仍是一个开放问题。本文提出一种新颖的两阶段框架,从多模态 RGB-D 图像中提取判别性特征表示,用于物体与场景识别任务。第一阶段,采用预训练 CNN 模型作为骨干网络,在多个层次提取视觉特征。第二阶段,以全随机结构的递归神经网络(RNNs)高效地将这些特征映射为高层表示。为应对 CNN 激活的高维性,通过扩展 RNN 中随机性思想,提出了一种随机加权池化方案。多模态融合通过软投票方法实现,基于 RGB 与深度流各自独立的识别置信度(即 SVM 分数)计算权重。这在最终 RGB-D 分类性能中产生了一致的类标签估计。大量实验验证了 RNN 阶段的全随机结构成功将 CNN 激活编码为判别性稳固特征。在流行的 Washington RGB-D Object 与 SUN RGB-D Scene 数据集上的对比实验结果表明,所提方法在物体与场景识别任务中均取得了优于或媲美最先进方法的性能。代码见 https://github.com/acaglayan/CNN_randRNN。

关键词

引用

@article{arxiv.2004.12349,
  title  = {When CNNs Meet Random RNNs: Towards Multi-Level Analysis for RGB-D Object and Scene Recognition},
  author = {Ali Caglayan and Nevrez Imamoglu and Ahmet Burak Can and Ryosuke Nakamura},
  journal= {arXiv preprint arXiv:2004.12349},
  year   = {2022}
}

备注

15 pages, 9 figures, 5 tables (To appear in Computer Vision and Image Understanding, Elsevier)