中文

FreeQ-Graph:基于语义一致场景图的自由形式查询用于3D场景理解

计算机视觉与模式识别 2025-07-29 v2

摘要

在复杂3D场景中通过自由形式语言进行语义查询是一项重大挑战。现有的3D场景理解方法利用大规模训练数据和CLIP将文本查询与3D语义特征对齐。然而,其对训练数据中预定义词汇先验的依赖阻碍了自由形式语义查询。此外,近期先进方法依赖大语言模型(LLM)进行场景理解,但缺乏全面的3D场景级信息,且常常忽略LLM生成输出中潜在的不一致性。本文提出FreeQ-Graph,通过语义一致的场景图实现3D场景理解的自由形式查询。核心思想是从完整且准确的3D场景图中编码自由形式查询,并将其与3D一致的语义标签对齐,这一目标通过三个关键步骤实现。首先,我们在完全不受训练数据或预定义先验约束的情况下,通过LLM和大型视觉语言模型(LVLM)指导构建完整且准确的3D场景图,将自由形式对象及其关系映射为图节点。最重要的是,我们利用合并超点的3D语义对齐特征将图节点与准确的语义标签对齐,从而增强3D语义一致性。为实现自由形式语义查询,我们进一步设计了一种基于LLM的推理算法,结合场景级和对象级信息进行复杂推理。我们在3D语义定位、分割和复杂查询任务上进行了广泛实验,同时验证了图生成的准确性。在6个数据集上的实验表明,我们的模型在复杂自由形式语义查询和复杂关系推理方面均表现出色。

关键词

引用

@article{arxiv.2506.13629,
  title  = {FreeQ-Graph: Free-form Querying with Semantic Consistent Scene Graph for 3D Scene Understanding},
  author = {Chenlu Zhan and Yufei Zhang and Gaoang Wang and Hongwei Wang},
  journal= {arXiv preprint arXiv:2506.13629},
  year   = {2025}
}