从 RGB-D 图像学习丰富特征以用于物体检测与分割
计算机视觉与模式识别
2014-07-23 v1 机器人学
摘要
本文研究了利用语义丰富的图像和深度特征进行 RGB-D 图像物体检测的问题。我们提出了一种新的地心嵌入方法,用于深度图像,该方法除了水平视差外,还为每个像素编码了距地面高度和与重力的夹角。我们证明,这种地心嵌入在利用卷积神经网络学习特征表示方面优于使用原始深度图像。我们的最终物体检测系统实现了 37.3% 的平均精度,相较于现有方法相对提升了 56%。随后,我们专注于实例分割任务,即对检测器发现的物体实例所属像素进行标记。针对此任务,我们提出了一种决策森林方法,利用一系列查询形状和地心姿态特征的一元和二元测试,将检测窗口中的像素分类为前景或背景。最后,我们将物体检测器的输出应用于现有的超像素分类框架以进行语义场景分割,在我们研究的物体类别上,相较于当前最先进方法实现了 24% 的相对提升。我们相信,本文所代表的进展将促进感知技术在机器人等领域的应用。
引用
@article{arxiv.1407.5736,
title = {Learning Rich Features from RGB-D Images for Object Detection and Segmentation},
author = {Saurabh Gupta and Ross Girshick and Pablo Arbeláez and Jitendra Malik},
journal= {arXiv preprint arXiv:1407.5736},
year = {2014}
}
备注
To appear in the European Conference on Computer Vision (ECCV), 2014