BEVMOSNet:用于BEV移动目标分割的多模态融合
计算机视觉与模式识别
2025-03-06 v1
摘要
准确理解鸟瞰图( BEV)中动态对象的运动对于确保自动驾驶车辆可靠的障碍规避系统和顺畅的路径规划至关重要。然而,该任务相较于目标检测和分割等任务探索得相对有限,仅有少数近期基于视觉的方法 presenting初步发现,在低光、夜间以及雨雾等恶劣天气条件下显著恶化。相反,激光雷达和雷达传感器在这些场景中几乎不受影响,雷达还提供了目标的关键速度信息。因此,我们引入BEVMOSNet,据称是首个 end-to-end 多模态融合,利用摄像头、激光雷达和雷达精确预测 BEV 中的移动目标。在进行更深入的分析后,我们发现变形交叉注意力引导的传感器融合在 BEV 中的跨传感器知识共享方面存在最佳策略。虽然在 nuScenes 数据集上评估 BEVMOSNet,我们展示了相较于基于视觉的单模态基线 BEV-MoSeg (Sigatapu 等人, 2023) 整体IoU得分提升36.59%,相较于多模态 SimpleBEV (Harley 等人, 2022) 扩展用于运动分割任务提升2.35%,确立了该方法在 BEV 运动分割中处于最佳状态。
引用
@article{arxiv.2503.03280,
title = {BEVMOSNet: Multimodal Fusion for BEV Moving Object Segmentation},
author = {Hiep Truong Cong and Ajay Kumar Sigatapu and Arindam Das and Yashwanth Sharma and Venkatesh Satagopan and Ganesh Sistu and Ciaran Eising},
journal= {arXiv preprint arXiv:2503.03280},
year = {2025}
}
备注
In Proceedings of the 20th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications (2025)