LaSSM:基于局部聚合与状态空间模型的高效语义-空间查询解码用于3D实例分割
计算机视觉与模式识别
2026-02-12 v1
摘要
基于点云的查询式3D场景实例分割已取得显著性能。然而,现有方法因点云稀疏性导致查询初始化困境,同时依赖查询解码器中的计算密集注意力机制。我们因此引入LaSSM,优先考虑简单性与效率,同时保持竞争性能。具体而言,我们提出了一种分层语义-空间查询初始化器,通过考虑语义线索和空间分布,从超级点中派生查询集合,实现场景的全面覆盖和加速收敛。我们进一步提出了一种坐标引导的状态空间模型(SSM)解码器,用于逐步细化查询。新型解码器包含一种局部聚合方案,将模型限制在几何一致的区域内,以及一种空间双路径SSM模块,通过整合关联坐标信息来捕捉查询集合内部的依赖关系。我们的设计实现了高效的实例预测,避免了噪声信息的引入并减少了冗余计算。LaSSM在最新的ScanNet++ V2榜单中名列第一,相较于前最佳方法提高了2.5% mAP,仅使用1/3的FLOPs,展示了其在挑战性大规模场景实例分割中的优势。LaSSM也在ScanNet、ScanNet200、S3DIS和ScanNet++ V1基准测试中取得竞争性能,同时拥有更低的计算成本。 extensive ablation 研究和定性结果验证了我们设计的有效性。代码和权重可在 https://github.com/RayYoh/LaSSM 获取。
引用
@article{arxiv.2602.11007,
title = {LaSSM: Efficient Semantic-Spatial Query Decoding via Local Aggregation and State Space Models for 3D Instance Segmentation},
author = {Lei Yao and Yi Wang and Yawen Cui and Moyun Liu and Lap-Pui Chau},
journal= {arXiv preprint arXiv:2602.11007},
year = {2026}
}
备注
Accepted at IEEE-TCSVT