中文

用于RGB-D场景识别的深度CNN:从零学习优于从RGB-CNN迁移

计算机视觉与模式识别 2018-01-23 v1 机器学习

摘要

基于RGB图像的场景识别已得到广泛研究,并借助卷积神经网络(CNN)和大型场景数据集达到了非常显著的识别水平。相比之下,当前的RGB-D场景数据要有限得多,因此常通过迁移预训练的RGB CNN模型并用目标RGB-D数据集微调来利用RGB大型数据集。然而,我们表明这种方法存在难以触及底层结构的局限,而底层对于学习模态特定特征至关重要。相反,我们聚焦于底层,并提出一种替代策略来学习深度特征,结合来自图像块的局部弱监督训练与后续的全局图像微调。该策略能够在有限的深度图像下学习到极具判别力的深度特定特征,而无需借助Places-CNN。此外,我们提出了一种改进的CNN架构,以进一步匹配模型的复杂度和可用数据量。对于RGB-D场景识别,深度与RGB特征通过投影到公共空间并进一步学习一个多层分类器来结合,该分类器在端到端网络中联合优化。我们的框架在NYU2和SUN RGB-D上的深度仅及RGB-D组合数据均取得了最先进的准确率。

关键词

引用

@article{arxiv.1801.06797,
  title  = {Depth CNNs for RGB-D scene recognition: learning from scratch better than transferring from RGB-CNNs},
  author = {Xinhang Song and Luis Herranz and Shuqiang Jiang},
  journal= {arXiv preprint arXiv:1801.06797},
  year   = {2018}
}

备注

AAAI Conference on Artificial Intelligence 2017