中文

MLF-4DRCNet:面向自动驾驶3D目标检测的4D雷达与相机多层级融合

计算机视觉与模式识别 2025-09-24 v1

摘要

新兴的4D毫米波雷达可测量目标的距离、方位角、俯仰角和多普勒速度,因其高性价比和鲁棒性在自动驾驶中受到认可。然而,其点云表现出显著的稀疏性和噪声,限制了其在3D目标检测中的独立应用。近期的4D雷达-相机融合方法提供了有效的感知。然而,现有大多数方法采用了最初为LiDAR-相机融合设计的显式鸟瞰图融合范式,忽略了雷达的固有缺陷。具体而言,它们忽略了雷达点云稀疏且不完整的几何特征,并将融合局限于粗略的场景级整合。针对这些问题,我们提出了MLF-4DRCNet,一种通过4D雷达与相机图像多层级融合进行3D目标检测的新型两阶段框架。该模型融合了点级、场景级和候选级的多模态信息,实现了全面的特征表示。它包含三个关键组件:增强雷达点编码器(ERPE)模块、分层场景融合池化(HSFP)模块和候选级融合增强(PLFE)模块。ERPE在点级工作,利用2D图像实例对雷达点云进行致密化,并通过所提出的三重注意力体素特征编码器将其编码为体素。HSFP利用可形变注意力将多尺度体素特征与2D图像特征动态整合,以捕获场景上下文,并对融合后的特征进行池化。PLFE通过融合图像特征来精炼区域候选框,并进一步与HSFP的池化特征相整合。在View-of-Delft (VoD)和TJ4DRadSet数据集上的实验结果表明,MLF-4DRCNet实现了SOTA性能。值得注意的是,它在VoD数据集上取得了与基于LiDAR的模型相当的性能。

关键词

引用

@article{arxiv.2509.18613,
  title  = {MLF-4DRCNet: Multi-Level Fusion with 4D Radar and Camera for 3D Object Detection in Autonomous Driving},
  author = {Yuzhi Wu and Li Xiao and Jun Liu and Guangfeng Jiang and XiangGen Xia},
  journal= {arXiv preprint arXiv:2509.18613},
  year   = {2025}
}