中文

基于合成RGB-D训练深度网络的语义位姿

计算机视觉与模式识别 2015-08-05 v1

摘要

在这项工作中,我们解决从RGB-D图像进行室内场景理解的问题。具体而言,我们提议寻找常见家具类别的实例、其空间范围以及相对于通用类别模型的位姿。为此,我们使用一个深层、宽结构、多输出的卷积神经网络(CNN),同时预测可能物体的类别、位姿和位置。为克服缺乏大型标注RGB-D训练集(尤其是带位姿的)的问题,我们使用一个即时渲染管线,在训练的同时生成逼真的杂乱房间场景。随后我们在相对少量的公开可用标注RGB-D数据上进行迁移学习,发现我们的模型能够成功标注即使极具挑战性的真实场景。重要的是,我们训练的网络能够以惊人的准确度理解高度杂乱场景的噪声和稀疏观测,从非常有限的线索推断类别和位姿。此外,我们的神经网络仅适度深层,并联合计算类别、位姿和位置,因此总体运行时间显著快于现有方法,在GPU上并行在数秒内同时估计所有输出参数。

关键词

引用

@article{arxiv.1508.00835,
  title  = {Semantic Pose using Deep Networks Trained on Synthetic RGB-D},
  author = {Jeremie Papon and Markus Schoeler},
  journal= {arXiv preprint arXiv:1508.00835},
  year   = {2015}
}

备注

ICCV 2015 Submission