中文

结合点云语义与几何特征的3D目标检测

计算机视觉与模式识别 2021-10-12 v1

摘要

在本文中,我们研究基于体素的方法与基于点的方法的结合,并提出一种名为SGNet的端到端两阶段3D目标检测器,用于点云场景。基于体素的方法将场景体素化为规则网格,可利用当前基于卷积层的高级特征学习框架进行语义特征学习。而基于点的方法由于坐标的保留,能更好地提取点的几何特征。二者结合是从点云进行3D目标检测的有效方案。然而,当前大多数方法使用带有锚框的基于体素的检测头进行最终分类与定位。尽管预设锚框覆盖整个场景,但由于体素大小的限制,其不适用于具有更大场景和多类别的点云检测任务。在本文中,我们提出一个捕获语义与几何特征的体素到点模块(VTPM)。VTPM是一种最终在点空间实现3D目标检测的基于体素-点的模块,更利于小尺寸目标检测,并避免了推理阶段锚框的预设。此外,提出具有中心-边界感知置信度注意力的置信度调整模块(CAM),以解决感兴趣区域(RoI)选择中预测置信度与候选框之间的错位问题。本文提出的SGNet在KITTI数据集上取得了3D目标检测的state-of-the-art结果,尤其在骑行者等小尺寸目标检测上。实际上,截至2021年9月19日,在KITTI数据集上,SGNet在简单难度骑行者的3D和BEV检测中排名第1,在中等难度骑行者的3D检测中排名第2。

关键词

引用

@article{arxiv.2110.04704,
  title  = {3D Object Detection Combining Semantic and Geometric Features from Point Clouds},
  author = {Hao Peng and Guofeng Tong and Zheng Li and Yaqi Wang and Yuyuan Shao},
  journal= {arXiv preprint arXiv:2110.04704},
  year   = {2021}
}