中文

HybridTM:将 Transformer 与 Mamba 组合用于 3D 语义分割

计算机视觉与模式识别 2025-07-25 v1

摘要

Transformer 方法通过其强大的注意力机制在 3D 语义分割方面展现了惊人的能力,但其二次复杂度限制了其在大规模点云中对长程依赖的建模。虽然近期的 Mamba 方法提供了线性复杂度的高效处理,但在提取 3D 特征时表现不足。然而,在实际中有效地组合这两者的互补优势仍是一个开放挑战。本文提出 HybridTM,是首个将 Transformer 与 Mamba 集成用于 3D 语义分割的混合架构。此外,我们提出了内部层混合策略,将注意力和 Mamba 在更细粒度上结合,使其能够同时捕获长程依赖和细粒度局部特征。广泛的实验表明,我们的 HybridTM 在多样化的室内和户外数据集上具有有效性和广泛性。 Furthermore,我们的 HybridTM 在 ScanNet、ScanNet200 和 nuScenes 基准测试中实现了最先进的性能。代码将在 https://github.com/deepinact/HybridTM 上发布。

关键词

引用

@article{arxiv.2507.18575,
  title  = {HybridTM: Combining Transformer and Mamba for 3D Semantic Segmentation},
  author = {Xinyu Wang and Jinghua Hou and Zhe Liu and Yingying Zhu},
  journal= {arXiv preprint arXiv:2507.18575},
  year   = {2025}
}

备注

7 pages, 5 figures