中文

面向 3D 场景理解的开放词汇八叉树图

计算机视觉与模式识别 2026-03-18 v2

摘要

开放词汇 3D 场景理解对于具身智能体至关重要。近期研究利用预训练的视觉语言模型(VLM)进行对象分割并投影到点云上构建 3D 地图。尽管取得了进展,但点云是一组无序坐标,需占用大量存储空间,且不能直接传递占用信息或空间关系,使得现有方法在下游任务(如路径规划和基于文本的对象检索)方面效率不高。为解决这些问题,我们提出了 Octree-Graph,这是一种用于开放词汇 3D 场景理解的新型场景表示。具体而言,首先设计了 Chronological Group-wise Segment Merging(CGSM)策略和 Instance Feature Aggregation(IFA)算法,以获取 3D 实例及其对应的语义特征。随后,开发了自适应八叉树结构,该结构根据对象的形状可调地存储语义信息并描绘占用情况。最后构建 Octree-Graph,其中每个自适应八叉树充当图节点,边描述节点之间的空间关系。在多个广泛使用的数据集上开展的大量实验表明,该方法的通用性和有效性。代码可在 \href{https://github.com/yifeisu/OV-Octree-Graph}{这里}获取。

关键词

引用

@article{arxiv.2411.16253,
  title  = {Open-Vocabulary Octree-Graph for 3D Scene Understanding},
  author = {Zhigang Wang and Yifei Su and Chenhui Li and Dong Wang and Yan Huang and Bin Zhao and Xuelong Li},
  journal= {arXiv preprint arXiv:2411.16253},
  year   = {2026}
}

备注

Accepted by ICCV25. 11 pages, 7 figures