ZigzagPointMamba:面向点云理解的空间语义 Mamba
计算机视觉与模式识别
2025-10-28 v6
摘要
诸如 PointMamba 之类的状态空间模型(SSMs)能够以线性复杂度对点云自监督学习进行高效的特征提取,在计算效率上优于 Transformer。然而,现有的基于 PointMamba 的方法依赖于复杂的 token 排序和随机掩码,这破坏了空间连续性和局部语义相关性。我们提出了 ZigzagPointMamba 来应对这些挑战。我们方法的核心是一条简单的之字形扫描路径,它对点云 token 进行全局排序,通过保持空间相邻点 token 的邻近性来增强空间连续性。然而,随机掩码会破坏自监督学习中的局部语义建模。为了解决这个问题,我们引入了语义孪生掩码策略(Semantic-Siamese Masking Strategy, SMS),该策略对语义相似的 token 进行掩码,通过整合原始 token 和相似 token 的局部特征来促进重建。这克服了对孤立局部特征的依赖,并实现了鲁棒的全局语义建模。我们预训练的 ZigzagPointMamba 权重显著改善了下游任务,在 ShapeNetPart 的部件分割任务上实现了 1.59% 的 mIoU 提升,在 ModelNet40 的分类任务上准确率提高了 0.4%,并在 ScanObjectNN 的 OBJ-BG、OBJ-ONLY 和 PB-T50-RS 子集的分类任务上分别提高了 0.19%、1.22% 和 0.72% 的准确率。
引用
@article{arxiv.2505.21381,
title = {ZigzagPointMamba: Spatial-Semantic Mamba for Point Cloud Understanding},
author = {Linshuang Diao and Sensen Song and Yurong Qian and Dayong Ren},
journal= {arXiv preprint arXiv:2505.21381},
year = {2025}
}