OpenScene:基于开放词汇表的 3D 场景理解
计算机视觉与模式识别
2023-04-07 v2
摘要
传统的 3D 场景理解方法依赖于有标签的 3D 数据集,以在有监督下训练用于单一任务的模型。我们提出 OpenScene,一种替代方法,其中模型预测 3D 场景点的密集特征,这些特征与 CLIP 特征空间中的文本和图像像素共同嵌入。这种零样本方法实现了任务无关的训练和开放词汇表查询。例如,为了执行 SOTA 零样本 3D 语义分割,它首先为每个 3D 点推断 CLIP 特征,然后根据与任意类别标签的嵌入的相似性对它们进行分类。更有趣的是,它实现了一系列以前从未做过的开放词汇表场景理解应用。例如,它允许用户输入任意文本查询,然后查看指示场景中哪些部分匹配的热力图。我们的方法能够有效地识别复杂 3D 场景中的物体、材料、可供性、活动和房间类型,所有这些都使用一个在没有任何标记 3D 数据的情况下训练的单一模型。
引用
@article{arxiv.2211.15654,
title = {OpenScene: 3D Scene Understanding with Open Vocabularies},
author = {Songyou Peng and Kyle Genova and Chiyu "Max" Jiang and Andrea Tagliasacchi and Marc Pollefeys and Thomas Funkhouser},
journal= {arXiv preprint arXiv:2211.15654},
year = {2023}
}
备注
CVPR 2023. Project page: https://pengsongyou.github.io/openscene