中文

TransFusion:基于 Transformer 的鲁棒激光雷达-相机融合三维目标检测

计算机视觉与模式识别 2022-03-23 v1

摘要

激光雷达与相机是自动驾驶中三维目标检测的两类重要传感器。尽管传感器融合在该领域日益流行,但其针对劣质图像条件(如光照不佳与传感器错位)的鲁棒性仍待探索。现有融合方法易受此类条件影响,主要源于通过标定矩阵建立的激光雷达点与图像像素的硬关联。我们提出 TransFusion,一种具有软关联机制以应对劣质图像条件的鲁棒激光雷达-相机融合方案。具体而言,我们的 TransFusion 由卷积骨干网络与基于 transformer 解码器的检测头组成。解码器第一层利用稀疏目标查询集从激光雷达点云预测初始边界框,第二层解码器层自适应地将目标查询与有用图像特征融合,兼顾空间与上下文关系。transformer 的注意力机制使模型能自适应决定从图像中获取何处及何种信息,从而形成鲁棒且有效的融合策略。我们额外设计了一种图像引导的查询初始化策略,以应对点云中难以检测的目标。TransFusion 在大规模数据集上取得最先进性能。我们提供大量实验证明其针对退化图像质量与标定误差的鲁棒性。我们还将所提方法扩展至三维跟踪任务,并在 nuScenes 跟踪排行榜上获得第一名,显示出其有效性与泛化能力。

关键词

引用

@article{arxiv.2203.11496,
  title  = {TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection with Transformers},
  author = {Xuyang Bai and Zeyu Hu and Xinge Zhu and Qingqiu Huang and Yilun Chen and Hongbo Fu and Chiew-Lan Tai},
  journal= {arXiv preprint arXiv:2203.11496},
  year   = {2022}
}

备注

Accepted to CVPR2022; Code at \url{https://github.com/XuyangBai/TransFusion}; Based on this work, we achieve the 1st place in the leaderboard of nuScenes tracking