中文

M^3:稠密匹配 meets 多视角基础模型用于单视图高斯斯金森 SLAM

计算机视觉与模式识别 2026-03-18 v1

摘要

来自未校准单目视频的流式重建仍具有挑战性,因为它需要高精度的姿态估计和动态环境中计算高效的在线细化。虽然将 3D 基础模型与 SLAM 框架耦合是一个有前景的范式,但仍存在关键瓶颈:大多数多视角基础模型以 feed-forward manner 估计姿态,生成的像素级对应点缺乏严格几何优化所需的精度。为此,我们提出了 M^3,通过为多视角基础模型增添专用的匹配头来促进细粒度稠密对应点的生成,并将其集成到稳健的单视图高斯斯金森 SLAM 中。M^3 进一步通过引入动态区域抑制和跨推断内在对齐来增强跟踪稳定性。广泛的室内外基准实验表明,M^3 在姿态估计和场景重建方面实现了最佳精度。值得注意的是,与 VGGT-SLAM 2.0 相比,M^3 将 ATE RMSE 降低了 64.3%,在 ScanNet++ 数据集上相对于 ARTDECO 提升了 2.11 dB 的 PSNR。

关键词

引用

@article{arxiv.2603.16844,
  title  = {M^3: Dense Matching Meets Multi-View Foundation Models for Monocular Gaussian Splatting SLAM},
  author = {Kerui Ren and Guanghao Li and Changjian Jiang and Yingxiang Xu and Tao Lu and Linning Xu and Junting Dong and Jiangmiao Pang and Mulin Yu and Bo Dai},
  journal= {arXiv preprint arXiv:2603.16844},
  year   = {2026}
}

备注

Project page: https://city-super.github.io/M3/