用于点云三维目标检测的Pillar R-CNN
计算机视觉与模式识别
2023-02-28 v1
摘要
点云三维目标检测的性能取决于对原始点(基于栅格的体素或柱状表示)的有效表示。近期的两阶段三维检测器通常采用基于点-体素的R-CNN范式,即第一阶段借助三维体素骨干网络在鸟瞰图(BEV)表示上生成三维提议,第二阶段通过中间点表示对其进行精炼。其主要机制是利用中间关键点为从转换后的BEV表示恢复大量三维结构上下文。然而,熟练的点-体素特征交互使整个检测流程更为复杂且计算密集。在本文中,我们采取不同视角——基于柱状的BEV表示具备足够的容量来保留三维结构。鉴于BEV感知的最新进展,我们设计了一种概念简单却高效的两阶段三维检测架构,名为Pillar R-CNN。在稠化后的BEV特征图之上,Pillar R-CNN可轻松引入特征金字塔架构以生成多尺度三维提议,并采用简单的二维R-CNN风格检测头进行框精炼。我们的Pillar R-CNN在大规模Waymo Open Dataset上以极小的额外代价优于最先进的三维检测器。需强调的是,得益于高效且优雅的Pillar R-CNN架构,进一步探索BEV感知在自动驾驶等相关应用中的使用已成为可能。
引用
@article{arxiv.2302.13301,
title = {Pillar R-CNN for Point Cloud 3D Object Detection},
author = {Guangsheng Shi and Ruifeng Li and Chao Ma},
journal= {arXiv preprint arXiv:2302.13301},
year = {2023}
}