EP2P-Loc:面向大规模视觉定位的端到端三维点到二维像素定位
计算机视觉与模式识别
2023-09-15 v1
摘要
视觉定位是在提供的三维参考地图中估计查询图像的6-DoF相机位姿的任务。得益于近期各种三维传感器的进展,三维点云正成为构建参考地图更准确且负担得起的选项,但将三维点云的点与二维图像中的像素进行匹配以用于视觉定位的研究仍具挑战性。现有联合学习二维-三维特征匹配的方法因两种模态间的表征差异导致内点率低,而将通过分类绕过此问题的方法存在细化不佳的缺陷。在这项工作中,我们提出EP2P-Loc,一种新颖的大规模视觉定位方法,它缓解了此类外观差异并支持端到端的位姿估计训练。为增加内点数量,我们提出一种简单算法以移除图像中不可见的三维点,并在无需关键点检测的情况下找到所有二维-三维对应。为降低内存占用与搜索复杂度,我们采用由粗到精的策略:从二维图像提取块级特征,随后对每个三维点进行二维块分类,并通过位置编码获得精确对应的二维像素坐标。最后,我们在此任务中首次采用可微分PnP进行端到端训练。在基于2D-3D-S和KITTI新整理的大规模室内外基准上的实验中,我们表明相较现有视觉定位及图像到点云配准方法,我们的方法达到了最先进性能。
引用
@article{arxiv.2309.07471,
title = {EP2P-Loc: End-to-End 3D Point to 2D Pixel Localization for Large-Scale Visual Localization},
author = {Minjung Kim and Junseo Koo and Gunhee Kim},
journal= {arXiv preprint arXiv:2309.07471},
year = {2023}
}
备注
Accepted to ICCV 2023