中文

VoxelNextFusion:一种用于多模态 3D 物体检测的简单、统一且有效的体素融合框架

计算机视觉与模式识别 2025-03-05 v2

摘要

LiDAR-相机融合可以通过利用具有深度感知能力的 LiDAR 点与语义丰富的图像之间的互补信息,来提升 3D 物体检测的性能。现有的基于体素的方法在以一对一方式融合稀疏体素特征与密集图像特征时面临重大挑战,导致丧失了图像的优势(包括语义和连续性信息),从而导致次优的检测性能,尤其是在远距离处。在本文中,我们提出了 VoxelNextFusion,这是一种专为基于体素的方法设计的多模态 3D 物体检测框架,有效地弥合了稀疏点云与密集图像之间的差距。具体而言,我们提出了一种基于体素的图像流水线,涉及将点云投影到图像上以获取像素级和补丁级特征。然后利用自注意力机制融合这些特征以获得组合表示。此外,为解决补丁中存在的背景特征问题,我们提出了一种特征重要性模块,有效区分前景和背景特征,从而最小化背景特征的影响。我们在广泛使用的 KITTI 和 nuScenes 3D 物体检测基准上进行了大量实验。值得注意的是,在 KITTI 测试数据集上,与 Voxel R-CNN 基线相比,我们的 VoxelNextFusion 在困难级别下的汽车检测 [email protected] 提升了约 +3.20%。

关键词

引用

@article{arxiv.2401.02702,
  title  = {VoxelNextFusion: A Simple, Unified and Effective Voxel Fusion Framework for Multi-Modal 3D Object Detection},
  author = {Ziying Song and Guoxin Zhang and Jun Xie and Lin Liu and Caiyan Jia and Shaoqing Xu and Zhepeng Wang},
  journal= {arXiv preprint arXiv:2401.02702},
  year   = {2025}
}