中文

UniM-OV3D:基于细粒度特征表示的单模态开放词汇 3D 场景理解

计算机视觉与模式识别 2024-04-23 v3

摘要

3D 开放词汇场景理解旨在识别超越基础标签空间的任意新类别。然而,现有工作不仅未能充分利用 3D 领域中所有可用的模态信息,而且在表示每种模态的特征时也缺乏足够的粒度。在本文中,我们提出了一个统一的多模态 3D 开放词汇场景理解网络,即 UniM-OV3D,它将点云与图像、语言和深度对齐。为了更好地整合点云的全局和局部特征,我们设计了一个分层点云特征提取模块,以学习全面的细粒度特征表示。此外,为了促进从描述中学习由粗到细的点语义表示,我们提出利用分层 3D 描述对,利用 3D 场景各种视点间的几何约束。大量实验结果证明了我们的方法在开放词汇语义分割和实例分割中的有效性和优越性,在 ScanNet、ScanNet200、S3IDS 和 nuScenes 等室内外基准测试上均取得了 SOTA 性能。代码可在 https://github.com/hithqd/UniM-OV3D 获取。

关键词

引用

@article{arxiv.2401.11395,
  title  = {UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation},
  author = {Qingdong He and Jinlong Peng and Zhengkai Jiang and Kai Wu and Xiaozhong Ji and Jiangning Zhang and Yabiao Wang and Chengjie Wang and Mingang Chen and Yunsheng Wu},
  journal= {arXiv preprint arXiv:2401.11395},
  year   = {2024}
}

备注

Accepted by IJCAI 2024