中文

$L^3$:野外无地图视觉定位

计算机视觉与模式识别 2026-03-10 v1

摘要

标准的视觉定位方法通常需要对场景进行离线预处理以获取更佳性能所需的3D结构信息。这不可避免地引入了额外的计算和时间成本,以及存储场景表示的开销。在野外场景中进行视觉定位而无需任何离线预处理步骤是否可能?本文利用面向在线推断的前馈3D重建网络,提出了一种 novel 的无地图视觉定位框架 L3L^3。具体而言,通过在RGB图像上执行直接在线3D重建,随后基于2D-3D对应关系进行两阶段尺度恢复和姿态细化,L3L^3 在无需预构建或存储任何离线场景表示的情况下实现了高精度。广泛的实验表明,L3L^3 不仅在各种基准测试上的性能与最先进的解决方案相当,而且在稀疏场景(每个场景的参考图像更少)方面表现出显著优异的鲁棒性。

关键词

引用

@article{arxiv.2603.07937,
  title  = {$L^3$:Scene-agnostic Visual Localization in the Wild},
  author = {Yu Zhang and Muhua Zhu and Yifei Xue and Tie Ji and Yizhen Lao},
  journal= {arXiv preprint arXiv:2603.07937},
  year   = {2026}
}