用于全局定位的基于位姿的场景几何隐式学习
计算机视觉与模式识别
2023-12-19 v1 机器人学
摘要
全局视觉定位利用单张图像在先前已建图的区域中估计相机的绝对位姿。从单张图像获取位姿使许多机器人和增强/虚拟现实应用成为可能。受深度学习最新进展的启发,许多现有方法直接从输入图像中学习并回归 6 自由度位姿。然而,这些方法并未充分利用底层场景几何进行位姿回归。单目重定位的挑战在于监督训练数据的可用性极低,仅有图像对应的 6 自由度位姿。在本文中,我们提出利用这些最少可用的标签(即位姿)来学习场景的底层 3D 几何,并利用该几何来估计 6 自由度相机位姿。我们提出了一种学习方法,利用这些位姿标签和刚性对齐来学习场景的两种 3D 几何表示(\textit{X, Y, Z 坐标}),一种在相机坐标系中,另一种在全局坐标系中。给定单张图像,它估计这两种 3D 场景表示,然后对其进行对齐以估计与位姿标签匹配的位姿。这种公式化允许主动引入额外的学习约束,以最小化两种 3D 场景表示之间的 3D 对齐误差,以及 3D 全局场景表示与 2D 图像像素之间的 2D 重投影误差,从而提高定位精度。在推理阶段,我们的模型估计相机和全局坐标系下的 3D 场景几何,并对其进行刚性对齐以实时获取位姿。我们在三个常见的视觉定位数据集上评估了我们的工作,进行了消融研究,并表明我们的方法在所有数据集上的位姿精度均超越了 SOTA 回归方法。
引用
@article{arxiv.2312.02029,
title = {Implicit Learning of Scene Geometry from Poses for Global Localization},
author = {Mohammad Altillawi and Shile Li and Sai Manoj Prakhya and Ziyuan Liu and Joan Serrat},
journal= {arXiv preprint arXiv:2312.02029},
year = {2023}
}
备注
IEEE ROBOTICS AND AUTOMATION LETTERS. ACCEPTED NOVEMBER, 2023