结合跨模态Mamba与渐进式解码器的双域同质融合3D目标检测
计算机视觉与模式识别
2025-03-18 v2
摘要
在齐次 BEV 域中融合 LiDAR 和图像特征已成为自动驾驶中 3D 目标检测的主流方法。然而,这种范式受到过度特征压缩的制约。虽然一些工作探索了密集体素融合以实现更好的特征交互,但它们面临高计算成本和查询生成方面的挑战。此外,两个域中的特征不对齐导致检测精度次优。为了解决这些局限性,我们提出了一种双域同质融合网络(DDHFusion),它利用 BEV 和体素域的互补性,同时减轻了它们的缺点。具体而言,我们首先使用 lift-splat-shot 和我们提出的语义感知特征采样(SAFS)模块将图像特征转换为 BEV 和稀疏体素表示。后者通过丢弃不重要的体素显著降低了计算开销。接下来,我们引入同质体素和 BEV 融合(HVF 和 HBF)网络,用于各自域内的多模态融合。它们配备了新颖的跨模态 Mamba 模块,以解决特征不对齐问题并实现全面的场景感知。输出的体素特征被注入到 BEV 空间中,以补偿直接高度压缩带来的信息损失。在查询选择期间,在 BEV 域中实现了渐进式查询生成(PQG)机制,以减少由特征压缩引起的假阴性。此外,我们提出了一种渐进式解码器(QD),利用可变形注意力和多模态体素特征混合(MMVFM)模块,依次聚合上下文丰富的 BEV 特征和几何感知体素特征,以实现精确的分类和边界框回归。
引用
@article{arxiv.2503.08992,
title = {Dual-Domain Homogeneous Fusion with Cross-Modal Mamba and Progressive Decoder for 3D Object Detection},
author = {Xuzhong Hu and Zaipeng Duan and Pei An and Jun zhang and Jie Ma},
journal= {arXiv preprint arXiv:2503.08992},
year = {2025}
}
备注
13 pages, 9 figures