MV2DFusion:利用 modality-specific 对象语义进行多模态3D检测
计算机视觉与模式识别
2025-07-04 v2
摘要
自动驾驶的兴起显著增加了对稳健3D目标检测系统的需求。虽然摄像头和LiDAR传感器各自提供独特的优势——摄像头提供丰富的纹理信息,LiDAR提供精确的3D空间数据——但依赖单一模态往往导致性能受限。本文介绍了MV2DFusion,一种通过高级查询基融合机制整合两者优势的多模态检测框架。通过引入图像查询生成器以对齐图像特定属性,并引入点云查询生成器,MV2DFusion有效地结合了 modality-specific 对象语义,而不偏向单一模态。随后,稀疏融合过程可基于这些宝贵的对象语义完成,从而在各种场景中确保高效且准确的对象检测。我们的框架的灵活性使其能够集成任何基于图像和点云的检测器,展现出其适应性和潜在的未来发展。广泛的在nuScenes和Argoverse2数据集上的评估表明,MV2DFusion实现了最先进的性能,尤其在远距离检测场景中表现突出。
引用
@article{arxiv.2408.05945,
title = {MV2DFusion: Leveraging Modality-Specific Object Semantics for Multi-Modal 3D Detection},
author = {Zitian Wang and Zehao Huang and Yulu Gao and Naiyan Wang and Si Liu},
journal= {arXiv preprint arXiv:2408.05945},
year = {2025}
}