中文

AG-Fusion:用于复杂场景3D目标检测的自适应门控多模态融合

计算机视觉与模式识别 2025-10-28 v1 机器学习

摘要

多模态摄像机-LiDAR 融合技术已在3D目标检测中得到广泛应用,取得令人鼓舞的性能。然而,现有方法在由传感器降级或环境干扰构成的挑战场景中表现显著下降。我们提出一种新型自适应门控融合(AG-Fusion)方法,通过识别可靠模式来实现对复杂场景中不稳定信息的自适应集成,从而实现稳健的检测。具体而言,我们首先将每个模态的特征投影到统一的鸟瞰图(BEV)空间,并利用基于窗口的注意力机制对其进行增强。随后,设计基于跨模态注意力的自适应门控融合模块,将这些特征融合为对复杂环境稳健的 BEV 表示。此外,我们构建了一个名为 Excavator3D(E3D)的数据集,聚焦于挖掘机作业场景的复杂情况,用于基准测试。我们的方法不仅在标准 KITTI 数据集上以93.92%的准确率取得竞争成绩,还在具有挑战性的 E3D 数据集上显著以24.88%超越基准,展示了在复杂工业场景中对不可靠模态信息的卓越鲁棒性。

关键词

引用

@article{arxiv.2510.23151,
  title  = {AG-Fusion: adaptive gated multimodal fusion for 3d object detection in complex scenes},
  author = {Sixian Liu and Chen Xu and Qiang Wang and Donghai Shi and Yiwen Li},
  journal= {arXiv preprint arXiv:2510.23151},
  year   = {2025}
}