中文

基于部分到全局课程的开词表 3D 语义分割 PGOV3D

计算机视觉与模式识别 2025-07-01 v1

摘要

现有的开词表 3D 语义分割方法通常通过将来自多视角图像(如 CLIP)提取的文本对齐特征合并到 3D 点上来监督 3D 分割模型。然而,这些方法仅将多视角图像当作传递开词表信息的中介,忽略了其丰富的语义内容和跨视角对应关系,这限制了模型的有效性。为此,我们提出了 PGOV3D,一种引入部分到全局课程以改进开词表 3D 语义分割的新框架。其核心创新在于两个阶段的训练策略。在第一个阶段,我们在提供密集语义信息但相对简单几何的部分场景上进行预训练。这些部分点云通过像素级深度投影自 multi-view RGB-D 输入生成。为实现开词表学习,我们利用多模态大语言模型(MLLM)和 2D 分割基础模型为每个视角生成开词表标签,提供丰富且对齐的监督。引入一个辅助的帧间一致性模块以强制跨不同视角的特征一致性并提升空间理解。在第二个阶段,我们在完整场景级的点云上进行微调,这些点云更稀疏且结构更复杂。我们聚合每个场景相关的部分词汇表,并使用预训练模型生成伪标签,有效弥合密集部分观察与大规模 3D 环境之间的语义鸿沟。在 ScanNet、ScanNet200 和 S3DIS 等基准测试上进行的大量实验表明,PGOV3D 在开词表 3D 语义分割方面实现了具竞争力的性能。

关键词

引用

@article{arxiv.2506.23607,
  title  = {PGOV3D: Open-Vocabulary 3D Semantic Segmentation with Partial-to-Global Curriculum},
  author = {Shiqi Zhang and Sha Zhang and Jiajun Deng and Yedong Shen and Mingxiao MA and Yanyong Zhang},
  journal= {arXiv preprint arXiv:2506.23607},
  year   = {2025}
}