中文

ContrastAlign:通过对比学习实现鲁棒的多模态三维目标检测BEV特征对齐

计算机视觉与模式识别 2025-08-20 v3

摘要

在三维目标检测任务领域,将来自LiDAR和相机传感器的异质特征融合到统一的鸟瞰图(BEV)表示中是一种广泛采用的范式。然而,现有方法常常受到不精确的传感器标定的影响,导致LiDAR-相机BEV融合中的特征错位。此外,这种不准确性会导致相机分支的深度估计误差,加剧LiDAR和相机BEV特征之间的错位。在这项工作中,我们提出了一种新颖的ContrastAlign方法,利用对比学习来增强异质模态的对齐,从而提高融合过程的鲁棒性。具体来说,我们的方法包含三个关键组件:(1) L-Instance模块,在LiDAR BEV特征中提取LiDAR实例特征;(2) C-Instance模块,通过在相机BEV特征上进行感兴趣区域(RoI)池化来预测相机实例特征;(3) InstanceFusion模块,采用对比学习来生成跨异质模态的一致实例特征。随后,我们使用图匹配来计算相邻相机实例特征与相似实例特征之间的相似度,以完成实例特征的对齐。我们的方法达到了SOTA性能,在nuScenes验证集上mAP为71.5%,超过GraphBEV 1.4%。重要的是,在存在空间和时间错位噪声的条件下,我们的方法优于BEVFusion,在nuScenes数据集上mAP分别提升了1.4%和11.1%。值得注意的是,在Argoverse2数据集上,ContrastAlign在mAP上比GraphBEV高出1.0%,这表明距离越远,特征错位越严重,我们的方法越有效。

关键词

引用

@article{arxiv.2405.16873,
  title  = {ContrastAlign: Toward Robust BEV Feature Alignment via Contrastive Learning for Multi-Modal 3D Object Detection},
  author = {Ziying Song and Hongyu Pan and Feiyang Jia and Yongchang Zhang and Lin Liu and Lei Yang and Shaoqing Xu and Peiliang Wu and Caiyan Jia and Zheng Zhang and Yadan Luo},
  journal= {arXiv preprint arXiv:2405.16873},
  year   = {2025}
}

备注

12 pages, 3 figures