中文

语义抽象:基于二维视觉-语言模型的开放世界三维场景理解

计算机视觉与模式识别 2022-12-07 v2 机器人学

摘要

我们研究开放世界三维场景理解,这是一类要求智能体以开放集词汇表和域外视觉输入对其三维环境进行推理的任务——这是机器人在非结构化三维世界中运作的关键能力。为此,我们提出了语义抽象(SemAbs),一个为二维视觉-语言模型(VLM)赋予新三维空间能力、同时保持其零样本鲁棒性的框架。我们利用从 CLIP 中提取的相关性图实现该抽象,并以语义无关的方式在这些抽象之上学习三维空间与几何推理能力。我们在两项开放世界三维场景理解任务上展示了 SemAbs 的效用:1)补全部分被观测的物体;2)根据语言描述定位隐藏物体。实验表明,SemAbs 在仅基于有限三维合成数据训练的情况下,能够泛化至新颖词汇、材质/光照、类别与领域(即真实世界扫描)。代码与数据发布于 https://semantic-abstraction.cs.columbia.edu/。

关键词

引用

@article{arxiv.2207.11514,
  title  = {Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models},
  author = {Huy Ha and Shuran Song},
  journal= {arXiv preprint arXiv:2207.11514},
  year   = {2022}
}

备注

16 pages, 9 figures, project website at https://semantic-abstraction.cs.columbia.edu/