中文

Open3DSG:基于点云的可查询对象与开集关系开放词汇 3D 场景图

计算机视觉与模式识别 2024-04-02 v2

摘要

当前的 3D 场景图预测方法依赖标注数据集来训练模型,以处理固定的一组已知对象类别和关系类别。我们提出了 Open3DSG,这是一种替代方法,旨在无需标注场景图数据的情况下,在开放世界中学习 3D 场景图预测。我们将 3D 场景图预测骨干网络的特征与强大的开放世界 2D 视觉 - 语言基础模型的特征空间进行协同嵌入。这使得我们能够通过从开放词汇中查询对象类别,并利用场景图特征和查询到的对象类别作为上下文,通过接地大语言模型(LLM)预测对象间关系,从而以零样本方式从 3D 点云预测 3D 场景图。Open3DSG 是首个不仅能预测显式开放词汇对象类别,还能预测不限于预定义标签集的开集关系的 3D 点云方法,从而能够在预测的 3D 场景图中表达罕见以及特定的对象和关系。我们的实验表明,Open3DSG 能有效预测任意对象类别及其复杂的对象间关系,包括空间、支撑、语义和比较关系。

关键词

引用

@article{arxiv.2402.12259,
  title  = {Open3DSG: Open-Vocabulary 3D Scene Graphs from Point Clouds with Queryable Objects and Open-Set Relationships},
  author = {Sebastian Koch and Narunas Vaskevicius and Mirco Colosi and Pedro Hermosilla and Timo Ropinski},
  journal= {arXiv preprint arXiv:2402.12259},
  year   = {2024}
}

备注

CVPR 2024. Project page: https://kochsebastian.com/open3dsg