中文

Mosaic3D:面向开放词汇三维分割的基础数据集与模型

计算机视觉与模式识别 2025-04-16 v2

摘要

我们通过引入一种新颖的数据生成流程和训练框架来解决开放词汇三维场景理解问题。我们的方法满足了有效训练的三个关键需求:精确的三维区域分割、全面的文本描述以及足够的数据集规模。通过利用最先进的开放词汇图像分割模型和区域感知的视觉-语言模型,我们开发了一个自动生成高质量三维掩码-文本对的流程。将该流程应用于多个三维场景数据集,我们创建了 Mosaic3D-5.6M,这是一个包含超过 3 万个标注场景和 560 万个掩码-文本对的数据集,其规模远超现有数据集。基于这些数据,我们提出了 Mosaic3D,这是一个基础模型,它结合了通过对比学习训练的三维编码器和一个轻量级掩码解码器,用于开放词汇的三维语义和实例分割。我们的方法在开放词汇三维语义和实例分割任务(包括 ScanNet200、Matterport3D 和 ScanNet++)上取得了最先进的结果,消融研究验证了我们大规模训练数据的有效性。

关键词

引用

@article{arxiv.2502.02548,
  title  = {Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation},
  author = {Junha Lee and Chunghyun Park and Jaesung Choe and Yu-Chiang Frank Wang and Jan Kautz and Minsu Cho and Chris Choy},
  journal= {arXiv preprint arXiv:2502.02548},
  year   = {2025}
}

备注

project page: https://nvlabs.github.io/Mosaic3D/