中文

Co-Fusion4D:用于稳健3D目标检测的时空协作融合

计算机视觉与模式识别 2026-05-21 v1 人工智能

摘要

在自动驾驶领域,3D目标检测对于准确的感知和可靠的决策至关重要。然而,目标运动和自车运动常导致基于鸟瞰图( BEV)的检测器之间出现跨帧时空不一致,引发时序鸟瞰图特征错位并降低时空一致性。为解决这些挑战,我们提出Co-Fusion4D,一个统一框架,显式保持跨帧时空一致性并抑制特征漂移。Co-Fusion4D采用当前帧为中心的策略,将当前帧作为主要信息来源,同时在时空滤波和对齐后选择性地融合历史帧。这种主导-补充机制有效缓解了累积性对齐误差,抑制了噪声特征传播,并利用可靠的时序线索以获得更一致的 BEV 表示。此外,Co-Fusion4D集成双注意力融合( DAF)模块进一步增强时空特征互动。DAF联合利用帧内空间注意力和帧间时序注意力,适应性地对齐和融合多帧特征,强调运动一致区域同时抑制伪相关。通过超越传统统一融合范式,该设计显著提高了 BEV 表示的时序稳定性和判别能力。在nuScenes基准测试中进行的广泛实验表明,Co-Fusion4D实现了最先进的性能,mAP达74.9%,NDS达75.6%,且无需测试时数据增强或外部数据。

关键词

引用

@article{arxiv.2605.20301,
  title  = {Co-Fusion4D: Spatio-temporal Collaborative Fusion for Robust 3D Object Detection},
  author = {Wenxuan Li and Qin Zou and Shoubing Chen and Chi Chen and Yingyi Yang and Shoubing Chen and Qingxiang Meng},
  journal= {arXiv preprint arXiv:2605.20301},
  year   = {2026}
}