中文

JOPP-3D:点云与全景图像的联合开放词汇语义分割

计算机视觉与模式识别 2026-03-13 v2

摘要

语义分割跨视觉模态(如3D点云和全景图像)仍是具有挑战性的任务,主要由于标注数据稀缺以及固定标签模型的适应性有限。在本文中,我们提出JOPP-3D,一种联合利用全景和点云数据的开放词汇语义分割框架,以实现语言驱动的场景理解。我们将RGB-D全景图像转换为相应的切向透视图像和3D点云,然后使用这些模态从基础视觉语言特征中提取并对齐特征。这使得自然语言查询能够在两种输入模态上生成语义掩码。在Stanford-2D-3D-s和ToF-360数据集上进行实验评估,表明JOPP-3D能够在全景和3D域之间产生连贯且语义上有意义的分割。我们的方法在开放词汇和封闭词汇2D和3D语义分割中均实现了显著提升。

关键词

引用

@article{arxiv.2603.06168,
  title  = {JOPP-3D: Joint Open Vocabulary Semantic Segmentation on Point Clouds and Panoramas},
  author = {Sandeep Inuganti and Hideaki Kanayama and Kanta Shimizu and Mahdi Chamseddine and Soichiro Yokota and Didier Stricker and Jason Rambach},
  journal= {arXiv preprint arXiv:2603.06168},
  year   = {2026}
}