中文

面向真实场景的语言 grounding 室内三维语义分割

计算机视觉与模式识别 2022-08-01 v2

摘要

基于深度神经网络的三维语义分割近期取得显著成功,在现有数据集上性能快速提升。然而,当前三维语义分割基准仅包含少量类别——例如 ScanNet 与 SemanticKITTI 均少于 30 类,不足以反映真实环境的多样性(例如语义图像理解涵盖数百至数千类)。因此,我们提出研究更大词表的三维语义分割,并在 ScanNet 数据上构建含 200 个类别的新扩展基准,数量级远超以往研究。如此大量的类别也带来严重的自然类别不平衡,二者均对现有三维语义分割方法构成挑战。为此,我们提出一种语言驱动的预训练方法,促使训练样本有限的所学三维特征靠近其预训练文本嵌入。大量实验表明,在我们的基准上,我们的方法持续优于最先进的三维预训练方法(+9% 相对 mIoU),在仅使用 5% 标注的有限数据场景下相对 mIoU 提升达 +25%。

关键词

引用

@article{arxiv.2204.07761,
  title  = {Language-Grounded Indoor 3D Semantic Segmentation in the Wild},
  author = {David Rozenberszki and Or Litany and Angela Dai},
  journal= {arXiv preprint arXiv:2204.07761},
  year   = {2022}
}

备注

Project page: https://rozdavid.github.io/scannet200, GitHub: https://github.com/RozDavid/LanguageGroundedSemseg, Video: https://www.youtube.com/watch?v=Cu-zW1oXrvU