中文

SceneVGGT:基于VGGT的在线3D语义SLAM用于室内场景理解与导航

机器人学 2026-02-20 v2 图像与视频处理

摘要

我们提出SceneVGGT,一个结合SLAM与语义映射的时空3D场景理解框架,用于自主和辅助导航。基于VGGT,我们的方法通过滑动窗口管道实现了长视频流的扩展。我们利用相机姿态变换对局部子图进行对齐,实现内存和速度高效的映射,同时保持几何一致性。语义通过VGGT跟踪头将2D实例掩码提升为3D对象,保持时间上的一致身份用于变化检测。作为一种概念证明,物体位置被投射到估计的地面平面上,用于辅助导航。管道的GPU内存使用始终保持在17 GB以下,无论输入序列长度如何,均在ScanNet++基准上实现了具竞争力的点云性能。总体而言,SceneVGGT确保了稳健的语义识别,并且足够快,以支持具有语音反馈的交互式辅助导航。

关键词

引用

@article{arxiv.2602.15899,
  title  = {SceneVGGT: VGGT-based online 3D semantic SLAM for indoor scene understanding and navigation},
  author = {Anna Gelencsér-Horváth and Gergely Dinya and Dorka Boglárka Erős and Péter Halász and Islam Muhammad Muqsit and Kristóf Karacs},
  journal= {arXiv preprint arXiv:2602.15899},
  year   = {2026}
}