STRMs:媲美 GPS 精度的视觉定位时空推理模型
计算机视觉与模式识别
2025-03-12 v1
摘要
本文通过一种受生物学启发的方法探索基于视觉的定位,该方法模仿了人类和动物在探索世界时如何将视图或视角联系起来。我们引入了两种序列生成模型 VAE-RNN 和 VAE-Transformer,它们将第一人称视角(FPP)观测转换为全局地图视角(GMP)表示及精确的地理坐标。与基于检索的方法不同,我们的方法将定位构建为生成任务,学习视角之间的直接映射,而无需依赖密集的卫星图像数据库。我们在两个真实世界环境中评估了这些模型:一个由 Jackal 机器人导航的大学校园,以及一个由 Tesla 轿车导航的城市市中心区域。VAE-Transformer 实现了出色的精度,中位偏差分别为 2.29m(占环境尺寸的 1.37%)和 4.45m(占环境尺寸的 0.35%),优于 VAE-RNN 和先前的跨视角地理定位方法。我们全面的定位性能特征(LPC)分析表明,VAE-Transformer 取得了 0.777 的 AUC,相比之下 VIGOR 200 为 0.295,TransGeo 为 0.225,确立了基于视觉定位的新 SOTA。在某些场景下,我们的视觉系统可媲美商用智能手机 GPS 的精度(AUC 为 0.797),同时所需的 GPU 内存减少 5 倍,并且在跨视角地理定位中的推理速度比现有方法快 3 倍。这些结果表明,受生物空间导航启发的模型能够有效记忆复杂、动态的环境,并以极少的计算资源提供精确的定位。
引用
@article{arxiv.2503.07939,
title = {STRMs: Spatial Temporal Reasoning Models for Vision-Based Localization Rivaling GPS Precision},
author = {Hin Wai Lui and Jeffrey L. Krichmar},
journal= {arXiv preprint arXiv:2503.07939},
year = {2025}
}
备注
11 pages, 6 figures