FusionViT:基于LiDAR-相机视觉Transformer融合的层次化三维目标检测
计算机视觉与模式识别
2023-11-08 v1
摘要
对于三维目标检测,相机和激光雷达均已被证明是有用的传感设备,可提供关于同一场景的互补信息,其数据以不同模态表示,例如2D RGB图像与3D点云。对此类多模态传感器数据的有效表示学习与融合,对于更好的三维目标检测性能是必要且关键的。为解决该问题,本文引入一种新颖的基于视觉Transformer的三维目标检测模型,即FusionViT。与现有三维目标检测方法不同,FusionViT是一个纯ViT框架,其通过扩展Transformer模型以嵌入图像和点云来实现层次化架构,从而进行有效表示学习。此类多模态数据嵌入表示将进一步通过融合视觉Transformer模型融合在一起,然后将学习到的特征输入目标检测头,以对输入场景中的三维物体进行检测与定位。为证明FusionViT的有效性,我们在真实世界交通目标检测基准数据集KITTI和Waymo Open上进行了大量实验。值得注意的是,我们的FusionViT模型可达到最先进性能,不仅优于仅依赖相机图像或激光雷达点云的现有基线方法,也优于最新的多模态图像-点云深度融合方法。
引用
@article{arxiv.2311.03620,
title = {FusionViT: Hierarchical 3D Object Detection via LiDAR-Camera Vision Transformer Fusion},
author = {Xinhao Xiang and Jiawei Zhang},
journal= {arXiv preprint arXiv:2311.03620},
year = {2023}
}