Voxel R-CNN:迈向高性能基于体素的 3D 目标检测
计算机视觉与模式识别
2021-02-08 v2
摘要
近期 3D 目标检测的进展严重依赖于 3D 数据的表示方式,即基于体素或基于点的表示。许多现有的高性能 3D 检测器是基于点的,因为这种结构能更好地保留精确的点位置。然而,由于点存储的无序性,点级特征导致高计算开销。相比之下,基于体素的结构更适合特征提取,但由于输入数据被划分为网格,通常精度较低。在本文中,我们采取略有不同的视角——我们发现原始点的精确定位对于高性能 3D 目标检测并非必要,且粗糙的体素粒度也能提供充分的检测精度。秉持这一视角,我们设计了一个简单但有效的基于体素的框架,名为 Voxel R-CNN。通过两阶段方法中充分利用体素特征,我们的方法达到了与最先进的基于点的模型相当的检测精度,但仅以一小部分计算成本为代价。Voxel R-CNN 由一个 3D 骨干网络、一个 2D 鸟瞰图(BEV)区域提议网络和一个检测头组成。设计了一种体素 RoI 池化,直接从体素特征中提取 RoI 特征以进一步精修。在广泛使用的 KITTI 数据集和较新的 Waymo Open 数据集上进行了大量实验。我们的结果表明,与现有基于体素的方法相比,Voxel R-CNN 在保持实时帧处理速率(即在 NVIDIA RTX 2080 Ti GPU 上以 25 FPS 的速度)的同时提供了更高的检测精度。代码可在 \url{https://github.com/djiajunustc/Voxel-R-CNN} 获取。
引用
@article{arxiv.2012.15712,
title = {Voxel R-CNN: Towards High Performance Voxel-based 3D Object Detection},
author = {Jiajun Deng and Shaoshuai Shi and Peiwei Li and Wengang Zhou and Yanyong Zhang and Houqiang Li},
journal= {arXiv preprint arXiv:2012.15712},
year = {2021}
}
备注
AAAI2021