中文

Fusion4CA:通过充分利用图像提升 3D 物体检测

计算机视觉与模式识别 2026-03-06 v1

摘要

当下越来越多的工作在鸟瞰图( BEV)空间融合 LiDAR 和 RGB 数据进行自动驾驶系统中的 3D 物体检测。然而,现有方法过度依赖 LiDAR 分支,对 RGB 信息的探索不足。为此,我们提出 Fusion4CA,基于经典 BEVFusion 框架,专注于充分挖掘视觉输入,采用即插即用的组件。具体而言,设计了对比度对齐模块以校准图像特征与 3D 几何,引入相机辅助分支以充分挖掘训练期间的 RGB 信息。为进一步提升性能,我们利用即插即用的认知适配器充分利用预训练图像权重,将标准坐标注意力模块集成到融合阶段作为补充提升。在 nuScenes 数据集上进行实验,表明本方法仅需6个训练 epoch,推理参数增加仅3.48%,即可实现69.7%的 mAP,较在20个 epoch下完全训练的基线提升1.2%。在模拟月球环境下的大规模实验进一步验证了方法的有效性与普适性。我们的代码将通过 Fusion4CA 发布。

关键词

引用

@article{arxiv.2603.05305,
  title  = {Fusion4CA: Boosting 3D Object Detection via Comprehensive Image Exploitation},
  author = {Kang Luo and Xin Chen and Yangyi Xiao and Hesheng Wang},
  journal= {arXiv preprint arXiv:2603.05305},
  year   = {2026}
}