中文

CoIn3D:重新审视配置不变的多摄像机3D目标检测

计算机视觉与模式识别 2026-03-27 v2 机器人学

摘要

多摄像机3D目标检测(MC3D)因多传感器物理智能体(如机器人和自动驾驶车辆)的部署而受到日益关注。然而,MC3D 模型仍难以泛化到具有新型多摄像机配置的未知平台。当前解决方案仅采用元摄像机进行统一表示,缺乏综合性考虑。本文重新审视了这一问题,确定问题根源在于源配置与目标配置之间空间先验的差异,包括不同的内参、外参和阵列布局。为此,我们提出了 CoIn3D,一个具有强大可迁移性的MC3D框架,使其能够从源配置有效迁移到未知目标配置。CoIn3D 通过空间感知特征调制(SFM)和相机感知数据增强(CDA)分别显式地将所有识别的空间先验纳入特征嵌入和图像观察中。SFM 通过整合四种空间表示(如焦距、地面深度、地面梯度和 Plücker 坐标)丰富特征空间。CDA 通过一种无需训练的动态新视角图像合成方案提高了在各种配置下观察的多样性。广泛的实验表明,在以 BEVDepth、BEVFormer 和 PETR 表示的三个主流MC3D范式下,CoIn3D 在 NuScenes、Waymo 和 Lyft 等著名数据集上实现了强大的跨配置性能。

关键词

引用

@article{arxiv.2603.05042,
  title  = {CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection},
  author = {Zhaonian Kuang and Rui Ding and Haotian Wang and Xinhu Zheng and Meng Yang and Gang Hua},
  journal= {arXiv preprint arXiv:2603.05042},
  year   = {2026}
}

备注

Accepted to CVPR 2026 main track