中文

SAS: 借助集成 2D 先验的任意 3D 场景分割

计算机视觉与模式识别 2025-03-12 v1

摘要

3D 模型的开放词汇能力日益受到重视,因为传统使用固定类别训练的方法无法在复杂动态 3D 场景中识别未见物体。在本文中,我们提出了一种简单而有效的方法 SAS,将多个 2D 模型的开放词汇能力迁移到 3D 域。具体而言,我们首先提出基于文本的模型对齐方法,利用文本作为桥梁将不同的 2D 模型映射到同一嵌入空间。然后,我们提出无标注模型能力构建方法,利用扩散模型显式量化 2D 模型识别不同类别的能力。在此基础上,在构建的模型能力引导下融合来自不同 2D 模型的点云特征。最后,通过特征蒸馏将集成的 2D 开放词汇能力迁移到 3D 域。SAS 在多个数据集(包括 ScanNet v2、Matterport3D 和 nuScenes)上大幅优于先前方法,其泛化能力也在下游任务(如高斯分割和实例分割)中得到进一步验证。

关键词

引用

@article{arxiv.2503.08512,
  title  = {SAS: Segment Any 3D Scene with Integrated 2D Priors},
  author = {Zhuoyuan Li and Jiahao Lu and Jiacheng Deng and Hanzhi Chang and Lifan Wu and Yanzhe Liang and Tianzhu Zhang},
  journal= {arXiv preprint arXiv:2503.08512},
  year   = {2025}
}