中文

学习有效的RGB-D表征用于场景识别

计算机视觉与模式识别 2018-10-30 v1

摘要

得益于Places等大型数据集,深度卷积网络(CNN)在RGB场景识别上可取得令人印象深刻的成果。相比之下,RGB-D场景识别因本文所针对的RGB-D数据两方面局限而仍欠发展。第一重局限是缺乏用于训练深度学习模型的深度数据。我们未采用微调或迁移RGB专用特征,而是通过提出一种架构与两步训练方法,利用块级弱监督直接学习有效的深度专用特征,从而应对该局限。所得的RGB-D模型亦受益于更具互补性的多模态特征。另一重局限是深度传感器量程短(通常0.5m至5.5m),导致深度图像无法捕捉RGB图像可捕获的场景远处物体。我们展示该局限可借助RGB-D视频解决,即随着相机在场景中移动,可累积更全面的深度信息。聚焦此场景,我们引入ISIA RGB-D视频数据集以评测基于视频的RGB-D场景识别。我们的视频识别架构结合了卷积与循环神经网络(RNN),并以三步、使用由简至繁的数据训练以学习有效特征(即块、帧与序列)。我们的方法在RGB-D图像(NYUD2与SUN RGB-D)及视频(ISIA RGB-D)场景识别上均取得当前最优性能。

关键词

引用

@article{arxiv.1809.06269,
  title  = {Learning Effective RGB-D Representations for Scene Recognition},
  author = {Xinhang Song and Shuqiang Jiang and Luis Herranz and Chengpeng Chen},
  journal= {arXiv preprint arXiv:1809.06269},
  year   = {2018}
}

备注

Accepted at IEEE Transactions on Image Processing