中文

GraphAlign:通过图匹配增强多模态三维目标检测的精确特征对齐

计算机视觉与模式识别 2024-01-11 v1

摘要

LiDAR与相机是自动驾驶中三维目标检测的互补传感器。然而,探索点云与图像之间非自然的相互作用具有挑战性,其关键因素在于如何进行异构模态间的特征对齐。当前许多方法仅通过投影标定实现特征对齐,未考虑传感器间坐标转换精度误差问题,导致次优性能。本文提出GraphAlign,一种基于图匹配的更精确的三维目标检测特征对齐策略。具体而言,我们在图像分支中融合来自语义分割编码器的图像特征,在LiDAR分支中融合来自3D Sparse CNN的点云特征。为节省计算量,我们通过计算划分后的点云特征子空间内的欧氏距离来构建最近邻关系。通过图像与点云间的投影标定,我们将点云特征的最近邻投影到图像特征上。随后通过将单个点云与多幅图像的最近邻进行匹配,我们搜索更合适的特征对齐。此外,我们提供自注意力模块以增强显著关系的权重,从而微调异构模态间的特征对齐。在nuScenes基准上的大量实验证明了我们的GraphAlign的有效性与高效性。

关键词

引用

@article{arxiv.2310.08261,
  title  = {GraphAlign: Enhancing Accurate Feature Alignment by Graph matching for Multi-Modal 3D Object Detection},
  author = {Ziying Song and Haiyue Wei and Lin Bai and Lei Yang and Caiyan Jia},
  journal= {arXiv preprint arXiv:2310.08261},
  year   = {2024}
}