用于鲁棒3D目标检测的多模态解耦与重耦网络
计算机视觉与模式识别
2026-03-10 v1
摘要
基于鸟瞰视图(BEV)的多模态3D目标检测已在基准数据集上取得显著进展。然而,由于LiDAR和摄像机传感器配置或摄像机场景条件的不同,实际应用中准确率可能显著下降。以往模型的一个设计瓶颈在于在融合过程中将多模态BEV特征紧密耦合,这可能会因某一模态或两者同时受损而影响整体系统性能。为缓解此问题,我们提出了一种用于数据受损情况下的鲁棒3D目标检测的多模态解耦与重耦网络(Multi-Modal Decouple and Recouple Network)。不同模态通常会共享一些高层不变特征。我们观察到,这些跨模态的不变特征并不总是同时失效,因为不同类型的数据损坏对每个模态的影响各不相同。这些不变特征可以在数据受损的情况下进行跨模态恢复,以实现鲁棒融合。为此,我们显式地将摄像机/LiDAR BEV特征解耦为模态不变部分和模态特定部分。这样可以让不变特征相互补偿,同时减轻单一受损模态对另一模态的负面影响。随后,我们将这些特征重耦合为三个专家,以分别处理不同类型的数据损坏情况,即LiDAR、摄像机以及两者。对于每个专家,我们使用模态不变特征作为可靠信息,同时将模态特定特征作为补充。最后,我们自适应地融合这三个专家,以获得用于3D目标检测的鲁棒特征。为进行验证,我们在nuScenes数据集上构建了一个包含大量LiDAR、摄像机以及两者数据损坏的基准测试集。该模型在训练时使用干净的nuScenes数据,在所有类型的数据损坏上进行测试。我们的方法在所有受损及干净数据上均优于最近的模型。
引用
@article{arxiv.2603.07486,
title = {Multi-Modal Decouple and Recouple Network for Robust 3D Object Detection},
author = {Rui Ding and Zhaonian Kuang and Yuzhe Ji and Meng Yang and Xinhu Zheng and Gang Hua},
journal= {arXiv preprint arXiv:2603.07486},
year = {2026}
}