FusionFormer:一种用于 3D 目标检测的鸟瞰图多感官融合与时间一致 Transformer
计算机视觉与模式识别
2023-10-10 v3
摘要
多传感器模态融合已在 3D 目标检测任务中展现出强大优势。然而,现有融合多模态特征的方法需将特征变换至鸟瞰图空间,可能丢失 Z 轴上的某些信息,从而导致性能不佳。为此,我们提出一种新颖的基于端到端多模态融合 Transformer 的框架,称为 FusionFormer,其在融合编码模块中结合了可变形注意力与残差结构。具体而言,通过设计均匀采样策略,我们的方法能够自发地从 2D 图像与 3D 体素特征中采样,从而利用灵活的适应性,并避免在特征拼接过程中显式变换至鸟瞰图空间。我们进一步在特征编码器中实现残差结构,以确保模型在缺失某一输入模态时的鲁棒性。通过在流行的自动驾驶基准数据集 nuScenes 上的大量实验,我们的方法在无测试时增强的 3D 目标检测任务中取得了 72.6% mAP 与 75.1% NDS 的最先进单模型性能。
引用
@article{arxiv.2309.05257,
title = {FusionFormer: A Multi-sensory Fusion in Bird's-Eye-View and Temporal Consistent Transformer for 3D Object Detection},
author = {Chunyong Hu and Hang Zheng and Kun Li and Jianyun Xu and Weibo Mao and Maochun Luo and Lingxuan Wang and Mingxia Chen and Qihao Peng and Kaixuan Liu and Yiru Zhao and Peihan Hao and Minzhe Liu and Kaicheng Yu},
journal= {arXiv preprint arXiv:2309.05257},
year = {2023}
}