回归特征:从像素到位姿的鲁棒相机定位学习
计算机视觉与模式识别
2021-04-09 v2
摘要
已知场景中的相机位姿估计是一项近期由多种学习算法解决的 3D 几何任务。许多方法从输入图像中回归精确的几何量,如位姿或 3D 点。这要么无法泛化到新视角,要么将模型参数绑定到特定场景。本文中,我们回归特征(Back to the Feature):我们认为深度网络应专注于学习鲁棒且不变的视觉特征,而几何估计应留给有原则性的算法。我们引入 PixLoc,一种与场景无关的神经网路,可根据图像和 3D 模型估计准确的 6-DoF 位姿。我们的方法基于多尺度深度特征的直接对齐,将相机定位视为度量学习。PixLoc 通过从像素到位姿的端到端训练学习强数据先验,并通过分离模型参数与场景几何展现出对新场景的卓越泛化能力。该系统能在给定粗略位姿先验的情况下在大型环境中定位,也可通过联合细化关键点与位姿以极小开销提升稀疏特征匹配的精度。代码将公开于 https://github.com/cvg/pixloc。
引用
@article{arxiv.2103.09213,
title = {Back to the Feature: Learning Robust Camera Localization from Pixels to Pose},
author = {Paul-Edouard Sarlin and Ajaykumar Unagar and Måns Larsson and Hugo Germain and Carl Toft and Viktor Larsson and Marc Pollefeys and Vincent Lepetit and Lars Hammarstrand and Fredrik Kahl and Torsten Sattler},
journal= {arXiv preprint arXiv:2103.09213},
year = {2021}
}
备注
Accepted to CVPR 2021