中文

我们真的需要场景特定的位姿编码器吗?

计算机视觉与模式识别 2020-12-23 v1 人工智能

摘要

视觉位姿回归模型通过单次前向传播从查询图像估计相机位姿。当前模型使用针对每个场景训练的深度卷积网络从图像中学习位姿编码。所得编码通常传递给多层感知机以回归位姿。在本工作中,我们提出位姿回归不需要场景特定的位姿编码器,且可改用为视觉相似性训练的编码。为验证我们的假设,我们采用由若干全连接层组成的浅层架构,并使用通用图像检索模型预计算的编码对其进行训练。我们发现这些编码不仅足以回归相机位姿,而且当提供给分支全连接架构时,训练后的模型可取得具有竞争力的结果,并在某些情况下甚至超越当前最优(state-of-the-art)位姿回归器。此外,我们表明对于室外定位,所提架构是迄今为止唯一能将误差稳定控制在 2 米和 5 度以内的位姿回归器。

关键词

引用

@article{arxiv.2012.12014,
  title  = {Do We Really Need Scene-specific Pose Encoders?},
  author = {Yoli Shavit and Ron Ferens},
  journal= {arXiv preprint arXiv:2012.12014},
  year   = {2020}
}

备注

To be presented at ICPR2020