用于 RGB-D 图像非模态 3D 目标检测的深度滑动形状
计算机视觉与模式识别
2016-03-10 v2
摘要
我们聚焦于 RGB-D 图像中的非模态 3D 目标检测任务,该任务旨在以度量形式生成目标完整范围的 3D 边界框。我们引入了深度滑动形状,这是一种 3D ConvNet 公式,以 RGB-D 图像的 3D 体积场景作为输入并输出 3D 目标边界框。在我们的方法中,我们提出了首个 3D 区域候选网络(RPN)以从几何形状中学习目标性,以及首个联合目标识别网络(ORN)以在 3D 中提取几何特征并在 2D 中提取颜色特征。具体而言,我们通过在两个不同尺度上训练非模态 RPN 以及训练 ORN 回归 3D 边界框来处理不同大小的目标。实验表明,我们的算法在 mAP 上比现有技术水平高出 13.8,并且比原始的滑动形状快 200 倍。所有源代码和预训练模型将在 GitHub 上提供。
引用
@article{arxiv.1511.02300,
title = {Deep Sliding Shapes for Amodal 3D Object Detection in RGB-D Images},
author = {Shuran Song and Jianxiong Xiao},
journal= {arXiv preprint arXiv:1511.02300},
year = {2016}
}