中文

ZFusion:一种用于自动驾驶中3D目标感知的相机与4D雷达有效融合器

计算机视觉与模式识别 2025-04-08 v2

摘要

可靠的3D目标感知是自动驾驶的关键。鉴于4D雷达在所有天气条件下的感知能力,近期受到广泛关注。然而,4D雷达提供的稀疏点云相较于LiDAR稀疏。本文提出一种3D目标检测方法,称为ZFusion,融合4D雷达与视觉两种模态。ZFusion的核心为我们提出的FP-DDCA(特征金字塔-双变形交叉注意力)融合器,有效补充稀疏雷达信息与密集视觉信息。具体而言,FP-DDCA融合器采用特征金字塔结构,将Transformer模块在不同尺度上进行交互式融合,从而提升感知精度。此外,我们利用深度-上下文-分割视图转换模块,考虑4D雷达的物理特性。鉴于4D雷达成本远低于LiDAR,ZFusion是LiDAR-based方法的有吸引力的替代方案。在典型交通场景(如VoD数据集)中,实验表明,ZFusion在合理推理速度下,在感兴趣区域实现了最新的mAP(平均精度),在整个区域保持与基线方法的竞争mAP,表现接近LiDAR,显著优于仅基于摄像头的方法。

关键词

引用

@article{arxiv.2504.03438,
  title  = {ZFusion: An Effective Fuser of Camera and 4D Radar for 3D Object Perception in Autonomous Driving},
  author = {Sheng Yang and Tong Zhan and Shichen Qiao and Jicheng Gong and Qing Yang and Jian Wang and Yanfeng Lu},
  journal= {arXiv preprint arXiv:2504.03438},
  year   = {2025}
}

备注

CVPR 2025 WDFM-AD