基于单幅图像与物体地图的三自由度定位:Flatlandia 问题与数据集
计算机视觉与模式识别
2023-11-09 v4
摘要
高效的视觉定位对许多应用至关重要,例如自主智能体的大规模部署与增强现实。传统视觉定位虽取得了显著的精度,却依赖于场景的庞大三维模型或大量带地理定位的图像集合,这类数据在存储及推广至新环境时往往效率低下。相比之下,人类利用非常抽象的二维地图、借助清晰可辨的地标位置来定向。受此及近期在二维抽象地图上探索定位工作的启发,我们提出了 Flatlandia,一种新颖的视觉定位挑战。借助 Flatlandia,我们研究是否可通过将视觉查询中检测到的常见物体布局与地图中已知物体空间布局进行比较来实现定位。我们将该挑战形式化为两个不同精度级别的任务,以探究该问题及其可能的局限;针对每个任务,我们提出了初始基线模型,并与 SOTA 的 6DoF 与 3DoF 方法进行比较。代码与数据集已公开于 github.com/IIT-PAVIS/Flatlandia。
引用
@article{arxiv.2304.06373,
title = {3DoF Localization from a Single Image and an Object Map: the Flatlandia Problem and Dataset},
author = {Matteo Toso and Matteo Taiana and Stuart James and Alessio Del Bue},
journal= {arXiv preprint arXiv:2304.06373},
year = {2023}
}