中文

FoundationSLAM:释放深度基础模型在端到端稠密视觉SLAM中的强大能力

计算机视觉与模式识别 2026-01-05 v2

摘要

我们提出了 FoundationSLAM,这是一种基于学习的单目稠密SLAM系统,旨在解决之前基于流的做法在准确性和鲁棒性方面缺乏几何一致性的问题。我们的核心思想是通过利用基础深度模型的指导,将流估计与几何推理相结合。为此,我们首先开发了一种混合流网络,产生几何感知的对应关系,使其在不同关键帧之间实现一致的深度和姿态推断。为强制全局一致性,我们提出了一种双一致性捆绑调整层,在多视图约束下联合优化关键帧姿态和深度。此外,我们引入了一种可靠性感知的细化机制,通过区分可靠区域和不确定区域,动态适应流更新过程,形成匹配和优化之间的闭环反馈。大量实验表明,FoundationSLAM 在多个具有挑战性的数据集上实现了优异的轨迹精度和稠密重建质量,同时以 18 FPS 的实时帧率运行,展示了强大的场景泛化能力和实际应用价值。

关键词

引用

@article{arxiv.2512.25008,
  title  = {FoundationSLAM: Unleashing the Power of Depth Foundation Models for End-to-End Dense Visual SLAM},
  author = {Yuchen Wu and Jiahe Li and Fabio Tosi and Matteo Poggi and Jin Zheng and Xiao Bai},
  journal= {arXiv preprint arXiv:2512.25008},
  year   = {2026}
}

备注

Accept at AAAI 2026 (Oral)