中文

OpenScene:基于开放词汇表的 3D 场景理解

计算机视觉与模式识别 2023-04-07 v2

摘要

传统的 3D 场景理解方法依赖于有标签的 3D 数据集,以在有监督下训练用于单一任务的模型。我们提出 OpenScene,一种替代方法,其中模型预测 3D 场景点的密集特征,这些特征与 CLIP 特征空间中的文本和图像像素共同嵌入。这种零样本方法实现了任务无关的训练和开放词汇表查询。例如,为了执行 SOTA 零样本 3D 语义分割,它首先为每个 3D 点推断 CLIP 特征,然后根据与任意类别标签的嵌入的相似性对它们进行分类。更有趣的是,它实现了一系列以前从未做过的开放词汇表场景理解应用。例如,它允许用户输入任意文本查询,然后查看指示场景中哪些部分匹配的热力图。我们的方法能够有效地识别复杂 3D 场景中的物体、材料、可供性、活动和房间类型,所有这些都使用一个在没有任何标记 3D 数据的情况下训练的单一模型。

关键词

引用

@article{arxiv.2211.15654,
  title  = {OpenScene: 3D Scene Understanding with Open Vocabularies},
  author = {Songyou Peng and Kyle Genova and Chiyu "Max" Jiang and Andrea Tagliasacchi and Marc Pollefeys and Thomas Funkhouser},
  journal= {arXiv preprint arXiv:2211.15654},
  year   = {2023}
}

备注

CVPR 2023. Project page: https://pengsongyou.github.io/openscene