中文

Faster-than-Real-Time Online 3D 语义场景图生成:FROSS 方法

计算机视觉与模式识别 2025-08-12 v2

摘要

将复杂3D环境抽象为简化且结构化表示的能力在多个领域中至关重要。3D语义场景图(SSG)通过将对象表示为节点、其相互关系表示为边,来实现这一目标,从而促进高层次场景理解。然而,现有方法面临计算需求高、非增量式处理等显著挑战,限制了其在实时开放世界应用中的适用性。为此,我们提出FROSS(Faster-than-Real-Time Online 3D Semantic Scene Graph Generation),一种创新方法,用于在线且超实时3D语义场景图生成,利用将2D场景图直接提升至3D空间的技术,对象表示为3D高斯分布。这一框架消除了对精确且计算密集型点云处理的依赖。此外,我们扩展了Replica数据集,添加了对象间关系注释,构建ReplicaSSG数据集以全面评估FROSS。在ReplicaSSG和3DSSG数据集上的实验结果表明,FROSS在实现卓越性能的同时,显著快于先前的3D SSG生成方法。我们的实现和数据集已公开于https://github.com/Howardkhh/FROSS。

关键词

引用

@article{arxiv.2507.19993,
  title  = {FROSS: Faster-than-Real-Time Online 3D Semantic Scene Graph Generation from RGB-D Images},
  author = {Hao-Yu Hou and Chun-Yi Lee and Motoharu Sonogashira and Yasutomo Kawanishi},
  journal= {arXiv preprint arXiv:2507.19993},
  year   = {2025}
}

备注

International Conference on Computer Vision (ICCV 2025)