中文

跨模态 Transformer:面向快速且鲁棒的 3D 目标检测

计算机视觉与模式识别 2023-09-19 v3

摘要

在本文中,我们提出了一种鲁棒的 3D 检测器,名为跨模态 Transformer(Cross Modal Transformer, CMT),用于端到端的 3D 多模态检测。无需显式的视角变换,CMT 以图像和点云 token 作为输入,直接输出精确的 3D 边界框。多模态 token 的空间对齐通过将 3D 点编码为多模态特征来实现。CMT 的核心设计相当简单,但其性能令人印象深刻。它在 nuScenes 测试集上取得了 74.1% 的 NDS(单模型 state-of-the-art),同时保持了快速的推理速度。此外,即使 LiDAR 缺失,CMT 也具有很强的鲁棒性。代码发布于 https://github.com/junjie18/CMT。

关键词

引用

@article{arxiv.2301.01283,
  title  = {Cross Modal Transformer: Towards Fast and Robust 3D Object Detection},
  author = {Junjie Yan and Yingfei Liu and Jianjian Sun and Fan Jia and Shuailin Li and Tiancai Wang and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2301.01283},
  year   = {2023}
}