CVFusion:基于跨视图融合的4D雷达和摄像头3D目标检测
计算机视觉与模式识别
2025-07-08 v1
摘要
4D 雷达因其在恶劣天气条件下的鲁棒性而受到自动驾驶领域的广泛关注。由于4D雷达稀疏点云和噪声测量,目前大多数研究通过集成摄像头图像并在BEV空间中进行模态融合来完成3D目标检测任务。然而,雷达和融合机制的潜力仍基本未被探索,限制了性能的提升。本文提出一种称为CVFusion的跨视图两阶段融合网络。在第一阶段,我们设计了一个雷达引导的迭代( RGIter) BEV融合模块,以生成高召回率的3D proposal框。在第二阶段,我们聚合来自多个异构视角(包括点云、图像和BEV)的特征,用于每个proposal。这些综合性的实例级特征有助于细化proposal并生成高质量的预测。在公开数据集上的大量实验表明,我们的方法在View-of-Delft (VoD) 和 TJ4DRadSet 上的mAP分别提高了9.10%和3.68%。我们的代码将对外公开。
引用
@article{arxiv.2507.04587,
title = {CVFusion: Cross-View Fusion of 4D Radar and Camera for 3D Object Detection},
author = {Hanzhi Zhong and Zhiyu Xiang and Ruoyu Xu and Jingyun Fu and Peng Xu and Shaohong Wang and Zhihao Yang and Tianyu Pu and Eryun Liu},
journal= {arXiv preprint arXiv:2507.04587},
year = {2025}
}