VGGT-Motion:面向长程一致性的感知自标定单目 SLAM
计算机视觉与模式识别
2026-02-06 v1
摘要
尽管近期通过 3D 视觉基础模型实现了感知自标定单目 SLAM 取得了进展,但在长序列中尺度漂移仍然严重。感知无关的分区方式破坏了情境一致性并导致零运动漂移,而传统几何对齐计算昂贵。为此,我们提出 VGGT-Motion,一个面向千米尺度轨迹的高效稳健全局一致性 SLAM 系统。具体而言,我们首先提出一种基于运动感知的子图构建机制,该机制利用光流引导自适应分区、修剪静态冗余并封装转弯,以实现稳定的局部几何。随后,我们设计了一种基于锚点的直接 Sim(3) 注册策略。通过利用情境平衡锚点,该策略实现无搜索、像素级稠密对齐和高效闭环,无需昂贵的特征匹配。最后,一个轻量级子图级姿态图优化确保线性复杂度下的全局一致性,实现可扩展的长程运行。实验表明,VGGT-Motion 在零-shot、长程感知自标定单目 SLAM 中显著提升了轨迹精度和效率,实现了最新的性能。
引用
@article{arxiv.2602.05508,
title = {VGGT-Motion: Motion-Aware Calibration-Free Monocular SLAM for Long-Range Consistency},
author = {Zhuang Xiong and Chen Zhang and Qingshan Xu and Wenbing Tao},
journal= {arXiv preprint arXiv:2602.05508},
year = {2026}
}