基于VGGT实现内存高效语义SLAM的时序一致3D图构建
计算机视觉与模式识别
2025-12-01 v2
摘要
我们提出一种基于Visual Geometry Grounded Transformer(VGGT)的快速时空场景理解框架。该提出的管道设计为实现高效、接近实时的性能,支持包括辅助导航等应用。为实现3D场景表示的连续更新,我们采用滑动窗口处理图像流,对子图进行对齐,从而克服了VGGT的高内存需求。我们利用VGGT跟踪头聚合2D语义实例掩码至3D对象。为实现时序一致性和更丰富的上下文推理,系统存储时间戳和实例级身份标识,从而实现对环境变化的检测。我们在著名基准数据集和专为辅助导航场景设计的自定义数据集上进行评估。结果表明,该框架适用于实际场景。
引用
@article{arxiv.2511.16282,
title = {Building temporally coherent 3D maps with VGGT for memory-efficient Semantic SLAM},
author = {Gergely Dinya and Péter Halász and András Lőrincz and Kristóf Karacs and Anna Gelencsér-Horváth},
journal= {arXiv preprint arXiv:2511.16282},
year = {2025}
}