中文

学习生成用于视觉定位的半稠密对应关系

计算机视觉与模式识别 2024-03-21 v2

摘要

本研究致力于解决在夜间场景、恶劣天气和季节变化等苛刻条件下进行视觉定位的挑战。虽然许多先前的研究专注于提升图像匹配性能以促进图像间可靠的稠密关键点匹配,但现有方法往往严重依赖于重建 3D 模型上的预定义特征点。因此,它们倾向于在匹配过程中忽略未观测到的关键点。结果是,稠密关键点匹配未被充分利用,导致精度显著下降,尤其是在噪声场景中。为解决这一问题,我们提出了一种新颖的定位方法,该方法基于稠密关键点匹配提取可靠的半稠密 2D-3D 匹配点。该方法涉及利用点推断网络将半稠密 2D 关键点回归到 3D 场景坐标。该网络利用几何和视觉线索,有效地从已观测关键点推断未观测关键点的 3D 坐标。丰富的匹配信息显著提高了相机位姿估计的精度,即使在涉及噪声或稀疏 3D 模型的场景中也是如此。综合评估表明,所提出的方法在挑战性场景中优于其他方法,并在大规模视觉定位基准测试中取得了具有竞争力的结果。代码将公开。

关键词

引用

@article{arxiv.2402.08359,
  title  = {Learning to Produce Semi-dense Correspondences for Visual Localization},
  author = {Khang Truong Giang and Soohwan Song and Sungho Jo},
  journal= {arXiv preprint arXiv:2402.08359},
  year   = {2024}
}

备注

Accepted at CVPR 2024