中文

基于视觉语言模型的室内场景理解系统——ROOT

计算机视觉与模式识别 2024-11-26 v1

摘要

最近,视觉语言模型(VLM)取得了显著进展,但这些模型在室内场景中的空间层次推理仍面临挑战。本研究中,我们引入ROOT系统,用于增强室内场景分析。具体而言,我们首先开发了一个基于GPT-4V的迭代对象感知算法,用于检测室内场景中的对象实体。随后,我们利用视觉基础模型获取场景的额外元信息,如边界框。基于这一基础数据,我们提出了一种专用的VLM,SceneVLM,能够生成空间层次场景图并为室内环境中的对象提供距离信息。这些信息增强了对室内场景空间布局的理解。为了训练我们的SceneVLM,我们收集了来自多个公共室内数据集的61万多张图片,并实现了一个基于半自动化技术的数据生成管道,用于建立对象之间的关系并估计室内对象的距离。通过利用这一丰富的数据,我们进行了各种训练配方并完成了SceneVLM的训练。我们的实验表明,ROOT系统便于室内场景理解,并在 diverse downstream applications(如3D场景生成和具身AI)中证明其有效性。该代码将在\url{https://github.com/harrytea/ROOT}发布。

关键词

引用

@article{arxiv.2411.15714,
  title  = {ROOT: VLM based System for Indoor Scene Understanding and Beyond},
  author = {Yonghui Wang and Shi-Yong Chen and Zhenxing Zhou and Siyi Li and Haoran Li and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2411.15714},
  year   = {2024}
}