中文

MVL-Loc:利用视觉语言模型实现可泛化的多场景相机重定位

计算机视觉与模式识别 2025-07-08 v1 人工智能

摘要

相机重定位是现代计算机视觉的一项基础能力,它从图像中精确确定相机的位置和姿态(6自由度),对于增强现实(AR)、混合现实(MR)、自动驾驶、送货无人机和机器人导航等应用至关重要。与传统的基于深度学习的方法(在单一场景中从图像回归相机姿态,在不同环境中通常缺乏泛化性和鲁棒性)不同,我们提出了MVL-Loc,一种新颖的端到端多场景6自由度相机重定位框架。MVL-Loc利用来自视觉语言模型(VLM)的预训练世界知识,并结合多模态数据,以在室内和室外环境中进行泛化。此外,自然语言被用作指导工具来引导多场景学习过程,促进对复杂场景的语义理解并捕捉物体之间的空间关系。在7Scenes和Cambridge Landmarks数据集上的大量实验证明了MVL-Loc在真实世界多场景相机重定位中的鲁棒性和最先进的性能,在位置和姿态估计方面均提高了精度。

关键词

引用

@article{arxiv.2507.04509,
  title  = {MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization},
  author = {Zhendong Xiao and Wu Wei and Shujie Ji and Shan Yang and Changhao Chen},
  journal= {arXiv preprint arXiv:2507.04509},
  year   = {2025}
}

备注

PRCV