中文

OpenFusion++:一个开放词汇实时场景理解系统

计算机视觉与模式识别 2025-04-29 v1

摘要

实时开放词汇场景理解是高效3D感知的关键,适用于视觉语言导航、具身智能和增强现实等应用。然而,现有方法存在实例分割不精确、语义更新静态以及对复杂查询处理有限的问题。为此,我们提出OpenFusion++,一个基于TSDF的实时3D语义-几何重建系统。我们的方法通过融合基础模型的置信度图来细化3D点云,基于实例面积的自适应缓存动态更新全局语义标签,采用双路径编码框架将对象属性与环境上下文集成,以实现精确的查询响应。在ICL、Replica、ScanNet和ScanNet++数据集上的实验表明,OpenFusion++在语义准确性和查询响应性方面显著优于基线方法。

关键词

引用

@article{arxiv.2504.19266,
  title  = {OpenFusion++: An Open-vocabulary Real-time Scene Understanding System},
  author = {Xiaofeng Jin and Matteo Frosi and Matteo Matteucci},
  journal= {arXiv preprint arXiv:2504.19266},
  year   = {2025}
}

备注

8 pages, 9 figures