VGGT-SLAM++
计算机视觉与模式识别
2026-04-09 v1 机器人学
摘要
我们提出了 VGGT-SLAM++,一个完整的视觉 SLAM 系统,利用视觉几何基础变换器(VGGT)富含几何信息的输出。该系统由一个融合 VGGT 前馈变换器与 Sim(3) 解的视觉里程计(前端的)、基于数字高程模型(DEM)的图构建模块,以及一个联合实现精确大规模建图且内存有界的后端组成。尽管先前的基于变换器的 SLAM 流水线(如 VGGT-SLAM)主要依赖稀疏回环闭合或全局 Sim(3) 流形约束——允许短时程姿态漂移——VGGT-SLAM++ 通过一个空间校正后端恢复了高频的局部束调整(BA)。对于每个 VGGT 子图,我们构建一个密集平面规范 DEM,将其划分为块,并计算其 DINOv2 嵌入以将子图融入共视图。空间邻居通过共视窗口内的视觉地点识别(VPR)模块检索,触发频繁的局部优化以稳定轨迹。在标准 SLAM 基准测试中,VGGT-SLAM++ 达到了最先进的精度,大幅减少了短时程漂移,加速了图收敛,并在紧凑 DEM 瓦片和次线性检索下保持了全局一致性。
引用
@article{arxiv.2604.06830,
title = {VGGT-SLAM++},
author = {Avilasha Mandal and Rajesh Kumar and Sudarshan Sunil Harithas and Chetan Arora},
journal= {arXiv preprint arXiv:2604.06830},
year = {2026}
}
备注
8 pages (main paper) + supplementary material. Accepted at CVPR 2026 Workshop (VOCVALC)