FGU3R:基于统一3D表示的多模态3D目标检测中的细粒度融合
计算机视觉与模式识别
2025-01-09 v1
摘要
多模态3D目标检测引起了广泛关注。然而,由于粗糙地将3D点与2D像素融合导致维度不匹配,这些多模态检测器在融合性能上表现不佳。本文提出一种名为 FGU3R 的多模态框架,通过统一3D表示和细粒度融合来解决上述问题,框架包含两个关键组件。首先,我们提出一种高效的原始点和伪点特征提取器,称为伪-原始卷积(Pseudo-Raw Convolution, PRConv),该模块同步调制多模态特征,并基于多模态交互在关键点上聚合不同类型点的特征。其次,设计了一种跨注意力自适应融合(Cross-Attention Adaptive Fusion, CAAF),用于对齐的3D感兴趣区(Region of Interest, RoI)特征进行细粒度自适应融合。通过上述方法实现了在统一3D表示上的细粒度融合。在KITTI 和 nuScenes 数据集上的实验表明了我们方法的有效性。
引用
@article{arxiv.2501.04373,
title = {FGU3R: Fine-Grained Fusion via Unified 3D Representation for Multimodal 3D Object Detection},
author = {Guoxin Zhang and Ziying Song and Lin Liu and Zhonghong Ou},
journal= {arXiv preprint arXiv:2501.04373},
year = {2025}
}
备注
Accepted by ICASSP 2025