中文

FGU3R:基于统一3D表示的多模态3D目标检测中的细粒度融合

计算机视觉与模式识别 2025-01-09 v1

摘要

多模态3D目标检测引起了广泛关注。然而,由于粗糙地将3D点与2D像素融合导致维度不匹配,这些多模态检测器在融合性能上表现不佳。本文提出一种名为 FGU3R 的多模态框架,通过统一3D表示和细粒度融合来解决上述问题,框架包含两个关键组件。首先,我们提出一种高效的原始点和伪点特征提取器,称为伪-原始卷积(Pseudo-Raw Convolution, PRConv),该模块同步调制多模态特征,并基于多模态交互在关键点上聚合不同类型点的特征。其次,设计了一种跨注意力自适应融合(Cross-Attention Adaptive Fusion, CAAF),用于对齐的3D感兴趣区(Region of Interest, RoI)特征进行细粒度自适应融合。通过上述方法实现了在统一3D表示上的细粒度融合。在KITTI 和 nuScenes 数据集上的实验表明了我们方法的有效性。

关键词

引用

@article{arxiv.2501.04373,
  title  = {FGU3R: Fine-Grained Fusion via Unified 3D Representation for Multimodal 3D Object Detection},
  author = {Guoxin Zhang and Ziying Song and Lin Liu and Zhonghong Ou},
  journal= {arXiv preprint arXiv:2501.04373},
  year   = {2025}
}

备注

Accepted by ICASSP 2025