中文

MAMBA4D: 基于解耦时空状态空间模型的高效长序列点云视频理解

计算机视觉与模式识别 2025-02-28 v3

摘要

点云视频能够忠实捕捉真实世界的空间几何和时间动态,这对于使智能体理解动态变化的世界至关重要。然而,设计有效的4D骨干网络仍然具有挑战性,主要由于点的分布不规则和无序以及帧间的时间不一致性。此外,基于Transformer的4D骨干网络通常由于二次复杂度而面临巨大的计算成本,特别是对于长视频序列。为应对这些挑战,我们提出了一种完全基于状态空间模型(SSMs)的新型点云视频理解骨干网络。具体来说,我们首先将4D视频序列中的空间和时间解耦,然后通过我们设计的Mamba模块建立时空相关性。开发了帧内空间Mamba模块,用于在特定时间步长内编码局部相似的几何结构。随后,局部相关的标记被传递到帧间时间Mamba模块,该模块以线性复杂度整合整个视频中的长期点特征。我们提出的Mamba4d在MSR-Action3D动作识别(准确率+10.4%)、HOI4D动作分割(F1分数+0.7)和Synthia4D语义分割(mIoU+0.19)数据集上取得了有竞争力的性能。特别是对于长视频序列,我们的方法具有显著的效率提升,GPU内存减少87.5%,速度提升5.36倍。代码将在https://github.com/IRMVLab/Mamba4D发布。

关键词

引用

@article{arxiv.2405.14338,
  title  = {MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models},
  author = {Jiuming Liu and Jinru Han and Lihao Liu and Angelica I. Aviles-Rivero and Chaokang Jiang and Zhe Liu and Hesheng Wang},
  journal= {arXiv preprint arXiv:2405.14338},
  year   = {2025}
}

备注

Accepted by CVPR 2025. The first two authors contribute equally