PillarMamba:基于混合状态空间模型的道路侧点云局部-全局上下文学习
计算机视觉与模式识别
2025-05-09 v1
摘要
为服务于智能运输系统(ITS)和车联网(V2X)任务,道路侧感知近年来受到越来越多的关注,因为它可以延扩展联网车辆的感知范围并提高交通安全。然而,道路侧点云导向的3D目标检测尚未得到有效探索。从一定程度上说,点云检测器性能的关键在于网络的感受野以及有效利用场景上下文的能力。近期基于状态空间模型(SSM)的Mamba技术因其高效的全局感受野而颠覆了长期以来作为基础构建块的传统卷积和变换器。在本工作中,我们将Mamba引入基于柱形的道路侧点云感知,提出一种基于交叉阶段状态空间组合(Cross-stage State-space Group,CSG)的框架,称为PillarMamba。它通过跨阶段特征融合增强了网络的表达性并实现了高效计算。然而,由于扫描方向的限制,状态空间模型面临局部连接被破坏和历史关系被遗忘的问题。为此,我们提出了混合状态空间模块(Hybrid State-space Block,HSB),以获取道路侧点云的局部-全局上下文。具体而言,它通过局部卷积增强邻域连接,通过残差注意力保留历史记忆。我们的方法在流行的大规模道路侧基准数据集DAIR-V2X-I上优于当前最先进的方法。代码将很快公开。
引用
@article{arxiv.2505.05397,
title = {PillarMamba: Learning Local-Global Context for Roadside Point Cloud via Hybrid State Space Model},
author = {Zhang Zhang and Chao Sun and Chao Yue and Da Wen and Tianze Wang and Jianghao Leng},
journal= {arXiv preprint arXiv:2505.05397},
year = {2025}
}