中文

CCF:互补协同融合用于域泛化多模态 3D 目标检测

计算机视觉与模式识别 2026-03-25 v1

摘要

多模态融合已成为实现精确 3D 目标检测的有前景范式。然而,当部署于与训练不同的目标域时,性能会显著下降。在本工作中,我们聚焦于双分支提案级检测器,识别出两个限制鲁棒跨域泛化的因素:1) 在雨天或夜间等具有挑战性的域中,一种模态可能经历严重退化;2) LiDAR 分支往往主导检测过程,导致视觉线索的系统性利用不足,并在点云受损时变得脆弱。为应对这些挑战,我们提出三个组件。第一,查询解耦损失为仅 2D、仅 3D 和融合查询提供独立监督,重新平衡模态间的梯度流。第二,LiDAR 引导深度先验通过图像预测和 LiDAR 推导的深度分布的概率融合,为 2D 查询补充实例感知的几何先验,改善其空间初始化。第三,互补跨模态掩码对图像和点云施加互补空间掩码,鼓励来自两种模态的查询在融合解码器中竞争,从而促进自适应融合。大量实验表明,与最先进基线相比实现了显著提升,同时保持了源域性能。代码和模型在 https://github.com/IMPL-Lab/CCF 上公开可用。

关键词

引用

@article{arxiv.2603.23276,
  title  = {CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection},
  author = {Yuchen Wu and Kun Wang and Yining Pan and Na Zhao},
  journal= {arXiv preprint arXiv:2603.23276},
  year   = {2026}
}

备注

Accepted to CVPR 2026