面向视觉定位的分层场景坐标分类与回归
计算机视觉与模式识别
2020-04-02 v3
摘要
视觉定位对计算机视觉与机器人领域的诸多应用至关重要。针对单图像RGB定位,最先进的基于特征的方法在查询图像与预构建三维模型之间匹配局部描述子。近年来,深度神经网络被用于回归原始像素与场景三维坐标之间的映射,从而通过前向传播隐式地完成匹配。然而,在庞大且存在歧义的环境中,单一网络直接学习此类回归任务较为困难。本文提出一种新的分层场景坐标网络,以由粗到精的方式从单张RGB图像预测像素场景坐标。该网络由一系列输出层组成,每一层均以前一层为条件。最终输出层预测三维坐标,其余层产生逐步更精细的离散位置标签。所提方法优于仅回归的基线网络,并允许我们训练紧凑模型,可鲁棒地扩展至大型环境。它在7-Scenes、12-Scenes、Cambridge Landmarks数据集及三个组合场景上树立了单图像RGB定位性能的新的最先进水平。此外,针对Aachen Day-Night数据集上的大规模室外定位,我们提出一种混合方法,优于现有的场景坐标回归方法,并显著缩小了相对于显式特征匹配方法的性能差距。
引用
@article{arxiv.1909.06216,
title = {Hierarchical Scene Coordinate Classification and Regression for Visual Localization},
author = {Xiaotian Li and Shuzhe Wang and Yi Zhao and Jakob Verbeek and Juho Kannala},
journal= {arXiv preprint arXiv:1909.06216},
year = {2020}
}
备注
CVPR 2020