基于图神经网络与相对位姿监督的视觉相机重定位
计算机视觉与模式识别
2021-04-13 v2
摘要
视觉重定位是指使用单幅图像作为输入来估计相机相对于预先记录环境的位置与朝向。得分最高的方法是“基于结构”的,并且需要查询相机的内参作为模型输入,并进行精细的几何优化。当内参缺失时,各种方法通过做出其他不同假设来竞争精度。这产生了相当好的定位分数,但模型在某种意义上是“狭窄”的,例如需要昂贵的测试时计算、或深度传感器、或多帧查询图像。相比之下,我们提出的方法几乎不做特殊假设,且在训练与测试中都相当轻量。我们的位姿回归网络仅从训练场景的相对位姿中学习。在推理时,它构建一幅将查询图像连接到训练对应图像的图,并使用图神经网络(GNN),其中节点上为图像表示、边上为图像对表示。通过在二者间高效传递消息,两类表示均被精炼以产生一致的相机位姿估计。我们在标准室内(7-Scenes)与室外(Cambridge Landmarks)相机重定位基准上验证了方法的有效性。我们的相对位姿回归方法匹配了绝对位姿回归网络的精度,同时保留了相对位姿模型的测试时速度与对非训练场景的泛化能力。
引用
@article{arxiv.2104.02538,
title = {Visual Camera Re-Localization Using Graph Neural Networks and Relative Pose Supervision},
author = {Mehmet Ozgur Turkoglu and Eric Brachmann and Konrad Schindler and Gabriel Brostow and Aron Monszpart},
journal= {arXiv preprint arXiv:2104.02538},
year = {2021}
}