中文

3DPillars:基于柱柱的双阶段3D目标检测

计算机视觉与模式识别 2025-09-09 v1

摘要

PointPillars是最快的3D目标检测器,利用伪图像表示对场景中3D目标进行特征编码。尽管高效,但PointPillars通常被state-of-the-art 3D检测方法所超越,原因在于:1)伪图像表示未能保留精确的3D结构,2)它们难以采用通常显示优于单阶段方法的3D目标提案。我们在本文中引入了首个利用伪图像表示的双阶段3D检测框架,缩小了PointPillars与state-of-the-art 方法之间的性能差距,同时保持其效率。该框架包含两个新型组件,克服了PointPillars上述局限性:首先,我们引入一种新型CNN架构,称为3DPillars,通过高效使用2D卷积学习来自伪图像表示的3D体素特征。3DPillars的基本思想是,3D体素特征可视为叠加的伪图像。为实现这一思想,我们提出了可分离体素特征模块,通过不使用3D卷积来提取体素特征。其次,我们引入一种带有稀疏场景上下文特征模块的RoI头,用于聚合来自3DPillars的多尺度特征,以获得稀疏场景特征。这一设计有效地采用了双阶段管道,充分利用场景的上下文信息以细化3D目标提案。在KITTI和Waymo Open数据集上的实验结果表明,我们的方法在速度和精度之间取得了良好的平衡。

关键词

引用

@article{arxiv.2509.05780,
  title  = {3DPillars: Pillar-based two-stage 3D object detection},
  author = {Jongyoun Noh and Junghyup Lee and Hyekang Park and Bumsub Ham},
  journal= {arXiv preprint arXiv:2509.05780},
  year   = {2025}
}

备注

19 pages, 11 figures