中文

MSF3DDETR:面向自动驾驶的多传感器融合 3D 检测 Transformer

计算机视觉与模式识别 2022-10-28 v1 机器学习 机器人学

摘要

3D 目标检测是自动驾驶的一项重要任务。最近,随着视觉 Transformer 的进步,2D 目标检测问题正通过集合到集合损失来处理。受这些 2D 目标检测方法以及一种多视图 3D 目标检测方法 DETR3D 的启发,我们提出了 MSF3DDETR:多传感器融合 3D 检测 Transformer 架构,用于融合图像和 LiDAR 特征以提高检测精度。我们的端到端、单阶段、无锚框且无 NMS 的网络接收多视图图像和 LiDAR 点云,并预测 3D 边界框。首先,我们使用新颖的 MSF3DDETR 交叉注意力块将从数据中学习到的目标查询与图像和 LiDAR 特征联系起来。其次,目标查询在多头自注意力块中相互交互。最后,MSF3DDETR 块重复 LL 次以细化目标查询。MSF3DDETR 网络在 nuScenes 数据集上使用基于匈牙利算法的二分匹配和受 DETR 启发的集合到集合损失进行端到端训练。我们展示了与最先进方法相比具有竞争力的定量和定性结果。

关键词

引用

@article{arxiv.2210.15316,
  title  = {MSF3DDETR: Multi-Sensor Fusion 3D Detection Transformer for Autonomous Driving},
  author = {Gopi Krishna Erabati and Helder Araujo},
  journal= {arXiv preprint arXiv:2210.15316},
  year   = {2022}
}

备注

Accepted at the ICPR 2022 Workshop DLVDR2022