UniBEV: 采用统一BEV编码器的多模态三维目标检测框架及其对缺失传感器模态的鲁棒性
计算机视觉与模式识别
2024-05-09 v3 机器人学
摘要
多传感器目标检测是自动驾驶中的活跃研究方向,但此类检测模型对缺失传感器输入(模态缺失,例如突发传感器故障)的鲁棒性这一关键问题仍研究不足。在本工作中,我们提出UniBEV,一种端到端多模态三维目标检测框架,专为应对模态缺失的鲁棒性而设计:UniBEV可在激光雷达加相机输入下运行,也可在无需重新训练的情况下仅用激光雷达或仅用相机输入运行。为使其检测头能处理不同输入组合,UniBEV旨在从各可用模态生成良好对齐的鸟瞰图(Bird's Eye View, BEV)特征图。与先前基于BEV的多模态检测方法不同,所有传感器模态均遵循统一方法将特征从原生传感器坐标系重采样至BEV特征。我们进一步研究了各种融合策略相对于模态缺失的鲁棒性:常用的特征拼接,以及通道平均,和一种称为通道归一化权重(Channel Normalized Weights)的加权平均泛化形式。为验证其有效性,我们在nuScenes上针对所有传感器输入组合将UniBEV与最先进的BEVFusion和MetaBEV进行比较。在此设定下,UniBEV在所有输入组合上平均达到 mAP,显著优于基线(BEVusion平均 mAP,MetaBEV平均 mAP)。消融实验显示了通过加权平均而非常规拼接进行融合、以及在各模态BEV编码器间共享查询所带来的鲁棒性收益。我们的代码可在 https://github.com/tudelft-iv/UniBEV 获取。
引用
@article{arxiv.2309.14516,
title = {UniBEV: Multi-modal 3D Object Detection with Uniform BEV Encoders for Robustness against Missing Sensor Modalities},
author = {Shiming Wang and Holger Caesar and Liangliang Nan and Julian F. P. Kooij},
journal= {arXiv preprint arXiv:2309.14516},
year = {2024}
}
备注
Accepted by IEEE Intelligent Vehicles Symposium (IV 2024), camera-ready. Code: https://github.com/tudelft-iv/UniBEV