中文

提升视觉:基于推理引导规划的地面到空中定位

机器学习 2026-01-01 v1 计算机视觉与模式识别

摘要

多模态智能发展近期在视觉理解和高层次推理方面显示出强劲进展。然而,大多数推理系统仍然依赖文本信息作为推理的主要媒介。这限制了它们在视觉导航和地理定位等空间任务中的有效性。本文讨论了该领域的潜在范围,并最终提出了一个名为地理一致性视觉规划的视觉推理范式,以及我们引入的框架——用于定位的视觉推理(ViReLoc),该框架仅使用视觉表示执行规划和定位。所提出的框架学习了基于文本的推理通常难以理解的空间依赖性和几何关系。通过在视觉域中编码逐步推理,并使用基于强化学习的目标进行优化,ViReLoc规划了两张给定地面图像之间的路线。该系统还集成了对比学习和自适应特征交互,以对齐跨视角视角并减少视点差异。在多种导航和定位场景中的实验表明,空间推理准确性和跨视角检索性能得到了一致提升。这些结果确立了视觉推理作为导航和定位的一种强大互补方法,并表明此类任务可以在没有实时全球定位系统数据的情况下执行,从而带来更安全的导航解决方案。

关键词

引用

@article{arxiv.2512.24404,
  title  = {Lifting Vision: Ground to Aerial Localization with Reasoning Guided Planning},
  author = {Soham Pahari and M. Srinivas},
  journal= {arXiv preprint arXiv:2512.24404},
  year   = {2026}
}