中文

通过数据级别的 LiDAR-相机融合增强伪框用于无监督 3D 目标检测

计算机视觉与模式识别 2025-08-29 v1

摘要

现有的基于 LiDAR 的 3D 目标检测器通常依赖手动标注的标签进行训练以获得良好性能。然而,获取高质量的 3D 标签需要大量时间和人力。为此,近期研究探索通过引入 RGB 图像作为辅助模态来辅助伪框生成实现无监督 3D 目标检测。然而,这些方法仅简单地整合由 LiDAR 点云和 RGB 图像生成的伪框。由于忽略了 LiDAR 和 RGB 图像数据在补充性方面的优势,这种标签级别的融合策略对伪框质量的提升有限。为克服上述局限性,我们提出了一种新颖的数据级别融合框架,在早期阶段整合 RGB 图像和 LiDAR 数据。具体而言,我们利用视觉基础模型对图像进行实例分割和深度估计,并引入一种双向融合方法,其中真实点从 2D 空间获取类别标签,而 2D 像素被投影到 3D 以增强真实点的密度。为缓解深度估计和分割估计带来的噪声,我们提出一种局部和全局过滤方法,该方法应用局部半径滤波以抑制深度估计误差,并应用全局统计滤波以移除分割引起的离群值。此外,我们提出一种基于数据级别融合的动态自演化策略,在稠密表示下迭代细化伪框,显著提高定位精度。在 nuScenes 数据集上的大量实验表明,我们的方法在 nuScenes 验证基准上以 28.4% 的 mAP 显著优于以前的状态-of-the-art 方法训练的检测器。

关键词

引用

@article{arxiv.2508.20530,
  title  = {Enhancing Pseudo-Boxes via Data-Level LiDAR-Camera Fusion for Unsupervised 3D Object Detection},
  author = {Mingqian Ji and Jian Yang and Shanshan Zhang},
  journal= {arXiv preprint arXiv:2508.20530},
  year   = {2025}
}

备注

Accepted by ACM MM 2025