3D地图中的视觉定位:点云、网格与NeRF表示的比较
计算机视觉与模式识别
2024-10-22 v2 机器人学
摘要
地图构建技术的最新进展使得在机器人任务期间能够创建高精度的稠密3D地图,例如点云、网格或基于NeRF的表示。这些发展为将这些地图重用于定位提供了新的机遇。然而,目前仍缺乏一种能够跨不同地图表示无缝运行的统一方法。本文提出并评估了一个全局视觉定位系统,该系统能够在使用视觉和激光雷达传感构建的各种3D地图表示中定位单个相机图像。我们的系统通过合成场景的新视角来生成数据库,创建RGB和深度图像对。利用精确的3D几何地图,我们的方法自动定义渲染姿态,在保持检索性能的同时减少了数据库图像的数量。为了弥合真实查询相机图像与合成数据库图像之间的领域差距,我们的方法利用了基于学习的描述子和特征检测器。我们通过在室内和室外环境中进行的广泛真实世界实验来评估系统的性能,评估了每种地图表示的有效性,并展示了其相对于传统运动恢复结构(SfM)定位方法的优势。结果表明,所有三种地图表示在各种环境中都能实现55%及以上的稳定定位成功率。NeRF合成图像表现出优越的性能,查询图像的平均定位成功率为72%。此外,我们展示了相对于基于SfM的方法的一个优势:我们的合成数据库能够实现在建图过程中未见过的反向行驶方向上的定位。我们的系统在配备GPU的移动笔记本电脑上实时运行,处理速率达到1Hz。
引用
@article{arxiv.2408.11966,
title = {Visual Localization in 3D Maps: Comparing Point Cloud, Mesh, and NeRF Representations},
author = {Lintong Zhang and Yifu Tao and Jiarong Lin and Fu Zhang and Maurice Fallon},
journal= {arXiv preprint arXiv:2408.11966},
year = {2024}
}