中文

用于基于图像定位的全帧场景坐标回归

计算机视觉与模式识别 2018-06-26 v2

摘要

基于图像的定位,或相机重定位,是计算机视觉与机器人学中的基本问题,其指从图像中估计相机位姿。近期最先进的方法使用基于学习的方法,如随机森林(RFs)和卷积神经网络(CNNs),对图像中每个像素回归其在场景世界坐标系中的对应位置,并利用预测出的对应关系通过基于 RANSAC 的优化方案求解最终位姿。在本文中,我们提议以全帧方式而非基于块的方式执行场景坐标回归,以使测试时计算高效,并且更重要的是,为回归过程增添更多全局上下文以提升鲁棒性。为此,我们采用全卷积编码器-解码器神经网络架构,其接受整幅图像作为输入并产出图像中所有像素的场景坐标预测。然而,使用更多全局上下文易于过拟合。为缓解该问题,我们提议使用数据增强来生成更多训练数据。除 2D 图像空间中的数据增强外,我们还在 3D 空间中对数据增强。我们在公开可用的 7-Scenes 数据集上评估我们的方法,实验表明其在场景坐标预测上更优,并在最难帧(例如具有重复结构的帧)上以改进的鲁棒性取得了定位的 SOTA 结果。

关键词

引用

@article{arxiv.1802.03237,
  title  = {Full-Frame Scene Coordinate Regression for Image-Based Localization},
  author = {Xiaotian Li and Juha Ylioinas and Juho Kannala},
  journal= {arXiv preprint arXiv:1802.03237},
  year   = {2018}
}

备注

RSS 2018