中文

一种通用的多模态融合检测框架

计算机视觉与模式识别 2024-01-23 v3 人工智能

摘要

激光雷达(LiDAR)点云已成为自动驾驶中最常见的数据源。然而,由于点云的稀疏性,在特定场景下无法实现准确可靠的检测。由于图像与点云的互补性,图像正受到越来越多的关注。尽管取得了一些成功,现有的融合方法要么执行硬融合,要么不以直接方式融合。在本文中,我们提出了一个称为MMFusion的通用3D检测框架,使用多模态特征。该框架旨在实现LiDAR与图像之间的准确融合,以改进复杂场景中的3D检测。我们的框架由两个独立的流组成:LiDAR流和相机流,可与任何单模态特征提取网络兼容。LiDAR流中的体素局部感知模块增强了局部特征表示,然后多模态特征融合模块选择性地组合来自不同流的特征输出以实现更好的融合。大量实验表明,我们的框架不仅优于现有基准,而且提升了它们的检测能力,特别是在KITTI基准上检测骑行者和行人方面,具有强大的鲁棒性和泛化能力。希望我们的工作能激发更多针对自动驾驶任务的多模态融合研究。

关键词

引用

@article{arxiv.2303.07064,
  title  = {A Generalized Multi-Modal Fusion Detection Framework},
  author = {Leichao Cui and Xiuxian Li and Min Meng and Xiaoyu Mo},
  journal= {arXiv preprint arXiv:2303.07064},
  year   = {2024}
}