中文

CVLNet:用于基于视频的相机定位的跨视角语义对应学习

计算机视觉与模式识别 2022-08-09 v1

摘要

本文解决跨视角基于视频的相机定位(CVL)问题。该任务是通过利用查询相机过去的观测信息(即先前时刻观察到的连续图像序列)并将其与大幅俯视卫星图像匹配来定位查询相机。该任务的关键挑战是为序列地面视角图像学习强大的全局特征描述子,同时考虑其与参考卫星图像的域对齐。为此,我们提出CVLNet,它首先通过探索地面与俯视几何对应关系将序列地面视角图像投影到俯视图,然后利用投影图像间的照片一致性形成全局表示。以此方式,跨视角域差异被弥合。由于参考卫星图像通常经过预裁剪和规则采样,查询相机位置与其匹配卫星图像中心之间总是存在错位。受此启发,我们提出在相似度匹配前估计查询相机相对于卫星图像的位移。在该位移估计过程中,我们还考虑了相机位置的不确定性,例如相机不太可能位于树顶。为评估所提方法性能,我们从Google Map收集KITTI数据集的卫星图像并构建了一个新的跨视角基于视频的定位基准数据集KITTI-CVL。大量实验证明了基于视频的定位优于基于单图像的定位,且所提各模块优于其他替代方案。

关键词

引用

@article{arxiv.2208.03660,
  title  = {CVLNet: Cross-View Semantic Correspondence Learning for Video-based Camera Localization},
  author = {Yujiao Shi and Xin Yu and Shan Wang and Hongdong Li},
  journal= {arXiv preprint arXiv:2208.03660},
  year   = {2022}
}

备注

22pages