中文

CRAFT:基于时空上下文融合 Transformer 的相机-雷达三维目标检测

计算机视觉与模式识别 2022-11-28 v2 人工智能 机器人学

摘要

与 LiDAR 相比,相机和雷达传感器在成本、可靠性和维护方面具有显著优势。现有的融合方法常在结果层融合单模态的输出,称为后融合策略。这可受益于使用现成的单传感器检测算法,但后融合无法充分利用传感器的互补特性,因此尽管相机-雷达融合潜力巨大,性能仍受限。在此我们提出一种新颖的提议级早融合方法,有效利用相机和雷达的空间与上下文特性进行三维目标检测。我们的融合框架首先在极坐标系中将图像提议与雷达点关联,以高效处理坐标系与空间特性之间的差异。以此作为第一阶段,后续基于连续交叉注意力的特征融合层在相机和雷达之间自适应地交换时空上下文信息,从而实现鲁棒且具注意力机制的融合。我们的相机-雷达融合方法在 nuScenes 测试集上取得了 41.1% mAP 和 52.3% NDS 的当前最优(SOTA)成绩,分别比纯相机基线高 8.7 和 10.8 个百分点,并在 LiDAR 方法上取得了具竞争力的性能。

关键词

引用

@article{arxiv.2209.06535,
  title  = {CRAFT: Camera-Radar 3D Object Detection with Spatio-Contextual Fusion Transformer},
  author = {Youngseok Kim and Sanmin Kim and Jun Won Choi and Dongsuk Kum},
  journal= {arXiv preprint arXiv:2209.06535},
  year   = {2022}
}

备注

Thirty-Seventh AAAI Conference on Artificial Intelligence (AAAI'23)