中文

Reloc3r:大规模训练的相对相机姿态回归,用于通用、快速且准确的视觉定位

计算机视觉与模式识别 2025-03-24 v2

摘要

视觉定位旨在确定查询图像相对于数据库中已定位图像的相机姿态。近年来,能够直接回归相机姿态的深度神经网络因其快速的推理能力而受到欢迎。然而,现有方法要么难以对新场景进行良好泛化,要么难以提供准确的相机姿态估计。为解决这些问题,我们提出了 Reloc3r,一个简单而有效的视觉定位框架。它由设计精妙的相对姿态回归网络组成,以及用于绝对姿态估计的极简运动平均模块。在约八百万对已定位图像对上训练的 Reloc3r 取得了意想不到的好性能和泛化能力。我们在六个公开数据集上进行了大量实验,始终展示了所提方法的有效性和效率。它能够实时提供高质量的相机姿态估计,并能泛化到新场景。代码:https://github.com/ffrivera0/reloc3r。

关键词

引用

@article{arxiv.2412.08376,
  title  = {Reloc3r: Large-Scale Training of Relative Camera Pose Regression for Generalizable, Fast, and Accurate Visual Localization},
  author = {Siyan Dong and Shuzhe Wang and Shaohui Liu and Lulu Cai and Qingnan Fan and Juho Kannala and Yanchao Yang},
  journal= {arXiv preprint arXiv:2412.08376},
  year   = {2025}
}

备注

CVPR 2025