跨模态 Transformer:面向快速且鲁棒的 3D 目标检测
计算机视觉与模式识别
2023-09-19 v3
摘要
在本文中,我们提出了一种鲁棒的 3D 检测器,名为跨模态 Transformer(Cross Modal Transformer, CMT),用于端到端的 3D 多模态检测。无需显式的视角变换,CMT 以图像和点云 token 作为输入,直接输出精确的 3D 边界框。多模态 token 的空间对齐通过将 3D 点编码为多模态特征来实现。CMT 的核心设计相当简单,但其性能令人印象深刻。它在 nuScenes 测试集上取得了 74.1% 的 NDS(单模型 state-of-the-art),同时保持了快速的推理速度。此外,即使 LiDAR 缺失,CMT 也具有很强的鲁棒性。代码发布于 https://github.com/junjie18/CMT。
引用
@article{arxiv.2301.01283,
title = {Cross Modal Transformer: Towards Fast and Robust 3D Object Detection},
author = {Junjie Yan and Yingfei Liu and Jianjian Sun and Fan Jia and Shuailin Li and Tiancai Wang and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2301.01283},
year = {2023}
}