SceneVGGT:基于VGGT的在线3D语义SLAM用于室内场景理解与导航
机器人学
2026-02-20 v2 图像与视频处理
摘要
我们提出SceneVGGT,一个结合SLAM与语义映射的时空3D场景理解框架,用于自主和辅助导航。基于VGGT,我们的方法通过滑动窗口管道实现了长视频流的扩展。我们利用相机姿态变换对局部子图进行对齐,实现内存和速度高效的映射,同时保持几何一致性。语义通过VGGT跟踪头将2D实例掩码提升为3D对象,保持时间上的一致身份用于变化检测。作为一种概念证明,物体位置被投射到估计的地面平面上,用于辅助导航。管道的GPU内存使用始终保持在17 GB以下,无论输入序列长度如何,均在ScanNet++基准上实现了具竞争力的点云性能。总体而言,SceneVGGT确保了稳健的语义识别,并且足够快,以支持具有语音反馈的交互式辅助导航。
引用
@article{arxiv.2602.15899,
title = {SceneVGGT: VGGT-based online 3D semantic SLAM for indoor scene understanding and navigation},
author = {Anna Gelencsér-Horváth and Gergely Dinya and Dorka Boglárka Erős and Péter Halász and Islam Muhammad Muqsit and Kristóf Karacs},
journal= {arXiv preprint arXiv:2602.15899},
year = {2026}
}