中文

SpaCeFormer:快速无提议的开放词汇 3D 实例分割

计算机视觉与模式识别 2026-04-23 v1 机器人学

摘要

开放词汇 3D 实例分割是机器人和 AR/VR 的核心能力,但先前的方法只是在不同瓶颈之间权衡:多阶段 2D+3D 管线以每场景数百秒的速度聚合基础模型输出,而伪标签端到端方法则依赖于碎片化的掩码和外部区域提议。我们提出了 SpaCeFormer,一种无提议的空间曲线 Transformer,每场景运行时间为 0.14 秒,比多阶段 2D+3D 管线快 2-3 个数量级。我们将其与 SpaCeFormer-3M 配对,这是最大的开放词汇 3D 实例分割数据集(包含来自 7.4K 场景的 604K 个实例的 3.0M 多视图一致描述),通过多视图掩码聚类和多视图 VLM 描述构建;其掩码召回率比先前的单视图管线高 21 倍(在 IoU > 0.5 时,54.3% 对比 2.5%)。SpaCeFormer 将空间窗口注意力与 Morton 曲线序列化相结合以获得空间连贯特征,并使用 RoPE 增强的解码器直接从学习到的查询中预测实例掩码,无需外部提议。在 ScanNet200 上,我们实现了 11.1 的零样本 mAP,比先前最佳的无提议方法提高了 2.8 倍;在 ScanNet++ 和 Replica 上,我们分别达到了 22.9 和 24.1 的 mAP,超越了所有先前方法,包括那些使用多视图 2D 输入的方法。

关键词

引用

@article{arxiv.2604.20395,
  title  = {SpaCeFormer: Fast Proposal-Free Open-Vocabulary 3D Instance Segmentation},
  author = {Chris Choy and Junha Lee and Chunghyun Park and Minsu Cho and Jan Kautz},
  journal= {arXiv preprint arXiv:2604.20395},
  year   = {2026}
}

备注

Project page: https://nvlabs.github.io/SpaCeFormer/