基于混合注意力的多模态传感器融合用于自动驾驶
计算机视觉与模式识别
2026-04-07 v1 机器学习
摘要
准确的自动驾驶3D目标检测需要互补的传感器。摄像机提供稠密语义信息但深度不可靠,而毫米波雷达提供精确的距离和速度测量,但几何稀疏。我们提出MMF-BEV(Radar-Camera BEV Fusion),一个基于可变形注意力的雷达-摄像机BEV融合框架,利用可变形注意力对View-of-Delft(VoD)4D雷达数据集上的跨模态特征对齐进行建模。MMF-BEV构建了一个基于BEVDepth的摄像机分支和一个基于RadarBEVNet的雷达分支,每个分支都增强了可变形自注意力机制,并通过可变形交叉注意力模块进行融合。我们评估了三种配置:摄像机-only、雷达-only和混合融合。传感器贡献分析量化了每个距离范围内的模态加权,提供了传感器互补性的可解释证据。采用两阶段训练策略——首先以深度监督预训练摄像机分支,然后联合训练雷达和融合模块,以稳定学习过程。在VoD数据集上实验表明,MMF-BEV在所有目标类别中都稳健地优于单模态基线方法,并在完整标注区域和近距离兴趣区域内与现有融合方法取得竞争成绩。
引用
@article{arxiv.2604.04797,
title = {Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving},
author = {Mayank Mayank and Bharanidhar Duraisamy and Florian Geiß and Abhinav Valada},
journal= {arXiv preprint arXiv:2604.04797},
year = {2026}
}
备注
9 pages, 8 figures