Frustum VoxNet:基于RGB-D或深度图像的3D目标检测
摘要
近来,出现了大量基于RGB以及3D图像的分类与检测系统。在这项工作中,我们描述了一种从RGB-D或仅深度点云进行3D目标检测的新系统。我们的系统首先在2D中检测目标(要么是RGB,要么是从深度构建的伪RGB)。下一步是在这些2D检测所定义的3D视锥体内检测3D目标。这是通过对视锥体的部分进行体素化(因为视锥体可能非常大)来实现的,而不是像早期工作那样使用整个视锥体。我们系统的主要新颖之处在于确定视锥体的哪些部分(3D候选框)进行体素化,从而允许我们在感兴趣的目标周围提供高分辨率表示。这也使我们的系统减少了内存需求。这些3D候选框被输入到一个高效的基于ResNet的3D全卷积网络(FCN)。我们的3D检测系统速度快,可集成到机器人平台中。与不进行体素化的系统(如PointNet)相比,我们的方法可以在不需要对数据集进行子采样的情况下运行。我们还引入了一种流水线方法,进一步提高了系统的效率。在SUN RGB-D数据集上的结果表明,我们基于小型网络的系统能够以每秒20帧的速度处理,并取得与最先进方法相当的检测结果,实现了2倍加速。
引用
@article{arxiv.1910.05483,
title = {Frustum VoxNet for 3D object detection from RGB-D or Depth images},
author = {Xiaoke Shen and Ioannis Stamos},
journal= {arXiv preprint arXiv:1910.05483},
year = {2023}
}
备注
Update for v3: Added 2D detection performance of using RGBDHS as input in appendix. page 8, add Acknowledgement. page 10, add Supplementary Material. The paper got accepted by 2020 Winter Conference on Applications of Computer Vision (WACV '20). The first arxiv version can be found here: arXiv:1910.05483