SNAP:面向任意点云的全景分割
计算机视觉与模式识别
2026-02-11 v2
摘要
交互式 3D 点云分割通过用户引导的提示实现了对复杂 3D 场景的高效标注。然而,当前方法通常仅限于单一领域(室内或户外),且仅支持单一种类用户交互方式(要么是空间点击,要么是文本提示)。此外,训练多个数据集常常导致负迁移,导致领域特定工具缺乏通用性。为此,我们提出了 SNAP(Segment aNything in Any Point cloud),一个支持跨领域、支持点基和文本基提示的统一 3D 分割模型。我们通过在覆盖室内、户外和航空环境的 7 个数据集上训练,并采用领域自适应归一化来防止负迁移,实现了跨领域的通用性。对于文本提示的分割,我们自动生成掩码提议并与文本查询的 CLIP 嵌入匹配,实现了全景分割和开放词汇分割。大量实验表明,SNAP 持续地提供高质量的分割结果。在 8 个零样本基准中实现空间提示分割的 SOTA 性能,并在所有 5 个文本提示基准中取得竞争性成绩。这些结果表明,统一模型可以与或超过特定领域方法,为可扩展的 3D 标注提供了实用工具。项目页面位于 https://neu-vi.github.io/SNAP/。
引用
@article{arxiv.2510.11565,
title = {SNAP: Towards Segmenting Anything in Any Point Cloud},
author = {Aniket Gupta and Hanhui Wang and Charles Saunders and Aruni RoyChowdhury and Hanumant Singh and Huaizu Jiang},
journal= {arXiv preprint arXiv:2510.11565},
year = {2026}
}
备注
Project Page, https://neu-vi.github.io/SNAP/