中文

基于时空虚拟网格的细粒度柱体特征编码用于 3D 目标检测

计算机视觉与模式识别 2024-03-12 v1 人工智能

摘要

开发高性能、实时的基于 LiDAR 的 3D 目标检测器架构对于自动驾驶汽车的成功商业化至关重要。基于柱体的方法因其计算效率高而成为车载部署的实用选择。然而,尽管效率很高,这些方法有时表现不如 Voxel-encoding 或 PointNet++ 等替代点编码技术。我们认为,当前基于柱体的方法未能充分捕获每个柱体结构内 LiDAR 点的细粒度分布。因此,柱体特征编码仍有相当大的改进空间。在本文中,我们引入了一种新颖的柱体编码架构,称为细粒度柱体特征编码(FG-PFE)。FG-PFE 利用时空虚拟(STV)网格来捕获每个柱体在垂直、时间和水平维度上的点云分布。通过 STV 网格,每个柱体内的点分别使用垂直 PFE(V-PFE)、时间 PFE(T-PFE)和水平 PFE(H-PFE)进行单独编码。然后,这些编码特征通过注意力柱体聚合方法进行聚合。我们在 nuScenes 数据集上进行的实验表明,FG-PFE 在 PointPillar、CenterPoint-Pillar 和 PillarNet 等基线模型上取得了显著的性能提升,且仅增加了微小的计算开销。

关键词

引用

@article{arxiv.2403.06433,
  title  = {Fine-Grained Pillar Feature Encoding Via Spatio-Temporal Virtual Grid for 3D Object Detection},
  author = {Konyul Park and Yecheol Kim and Junho Koh and Byungwoo Park and Jun Won Choi},
  journal= {arXiv preprint arXiv:2403.06433},
  year   = {2024}
}

备注

ICRA 2024