中文

通过引入Voxel2Pillar特征编码和提取多尺度特征来提高3D检测器性能

计算机视觉与模式识别 2024-11-14 v4

摘要

多线激光雷达在自动驾驶汽车中广泛应用,因此基于点云的3D检测器是自动驾驶的关键。由于不同类型物体尺寸差异显著,提取丰富的多尺度特征对基于点云的3D检测器至关重要。然而,由于实时要求, backbone 中很少使用大尺寸卷积核来提取大尺度特征。当前的3D检测器常使用特征金字塔网络获取大尺度特征;但某些包含较少点云的物体在下采样过程中会丢失,导致性能下降。由于基于柱体的方案计算量远低于基于体素的方案,因此更适合构建实时3D检测器。因此,我们提出了一种基于柱体的检测器。我们重新设计了特征编码、骨干网络和颈部结构。我们提出了Voxel2Pillar特征编码,该编码利用稀疏卷积构造具有更丰富点云特征(尤其是高度特征)的柱体。Voxel2Pillar为特征编码添加更多可学习参数,使初始柱体具有更高的性能能力。我们在提出的全稀疏骨干网络中提取多尺度和大尺度特征,该骨干网络不使用大尺寸卷积核;骨干网络由提出的多尺度特征提取模块构成。颈部由提出的稀疏ConvNeXt构成,其简洁的结构显著提高了性能。我们在Waymo Open数据集上验证了所提出方法的有效性,车辆、行人和骑行者的目标检测精度均得到提高。我们还通过消融研究详细验证了每个提出模块的有效性。

关键词

引用

@article{arxiv.2405.09828,
  title  = {*: Improving the 3D detector by introducing Voxel2Pillar feature encoding and extracting multi-scale features},
  author = {Xusheng Li and Chengliang Wang and Shumao Wang and Zhuo Zeng and Ji Liu},
  journal= {arXiv preprint arXiv:2405.09828},
  year   = {2024}
}

备注

Due to experimental data errors, it needs to be withdrawn