UniMamba:用于LiDAR-based 3D目标检测的统一空间-通道表示学习与高效Group Mamba
计算机视觉与模式识别
2025-10-20 v3
摘要
最近的LiDAR 3D检测进展表明,基于Transformer的框架在捕获点云空间的全局依赖性方面效果显著,通过将3D体素序列化为展平的1D序列进行迭代自注意力。然而,这种序列化过程不可避免地会破坏3D体素的空间结构。此外,由于3D体素数量庞大且Transformer的二次复杂度,多个序列在输入Transformer前会被分组,从而导致感受野受限。灵感来源于State Space Models(SSM)在2D视觉任务中取得的卓越性能,本文提出一种新型统一Mamba(UniMamba),旨在以简洁的多头方式无缝集成3D卷积和SSM的优势,旨在高效且同时实现“局部和全局”空间上下文聚合。具体而言,设计了一个UniMamba模块,主要由空间局部建模、互补Z-order序列化和局部-全局序列聚合器组成。空间局部建模模块集成了3D子域卷积,以在序列化前捕获动态空间位置嵌入。随后采用水平和垂直两种方向的高效Z-order曲线进行序列化。此外,局部-全局序列聚合器采用通道分组策略,使用多头SSM高效编码“局部和全局”空间相互依赖。此外,构建了一个由堆叠UniMamba模块构成的编码器-解码器架构,以支持层次化的多尺度空间学习。进行了在三个流行数据集上的大规模实验:nuScenes、Waymo和Argoverse 2。特别地,我们的UniMamba在nuScenes数据集上实现了70.2 mAP。
引用
@article{arxiv.2503.12009,
title = {UniMamba: Unified Spatial-Channel Representation Learning with Group-Efficient Mamba for LiDAR-based 3D Object Detection},
author = {Xin Jin and Haisheng Su and Kai Liu and Cong Ma and Wei Wu and Fei Hui and Junchi Yan},
journal= {arXiv preprint arXiv:2503.12009},
year = {2025}
}
备注
Accepted to CVPR2025