中文

基于体素渲染的特征提取用于相机定位

计算机视觉与模式识别 2025-05-22 v4 机器人学

摘要

相机定位方法包括稠密图像配准和直接从查询图像进行相机姿态回归。其中,稀疏特征匹配作为一种高效、通用且通常轻量级的方法,在众多应用中表现突出。然而,基于特征的方法往往在显著的视点和外观变化情况下难以处理,导致匹配失败和不准确的姿态估计。为克服这一限制,我们提出了一种新方法,利用全局稀疏但局部稠密的3D表示来表示2D特征。通过跟踪和三角化一系列帧中的特征标记,我们构建优化以渲染在跟踪期间观察到的图像块描述符的稀疏体素地图。给定初始姿态估计后,我们首先使用体积渲染从体素中综合描述符,然后进行特征匹配以估计相机姿态。该方法能够为未见的视点生成描述符,增强了对视点变化的鲁棒性。我们在7-Scenes和Cambridge Landmarks数据集上进行了广泛评估。结果表明,我们的方法在室内环境中显著优于现有最先进的特征表示技术,译作平行移动误差提高了39%。此外,我们的方法在室外场景中也能实现与其他方法相当的结果,同时保持更低的内存和计算成本。

关键词

引用

@article{arxiv.2409.07571,
  title  = {FaVoR: Features via Voxel Rendering for Camera Relocalization},
  author = {Vincenzo Polizzi and Marco Cannici and Davide Scaramuzza and Jonathan Kelly},
  journal= {arXiv preprint arXiv:2409.07571},
  year   = {2025}
}

备注

In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), Tucson, Arizona, US, Feb 28-Mar 4, 2025