基于OpenStreetMap的文本化定位方法TOL
计算机视觉与模式识别
2026-04-28 v2 多媒体
摘要
自然语言在地理空间应用中提供了直观的空间意图表达方式。虽然已有定位方法常依赖稠密点云地图或高分辨率影像,但OpenStreetMap(OSM)提供了紧凑且免费的地图表示,编码了丰富的语义和结构信息,使其非常适用于大规模定位。然而,文本到OSM(T2O)定位仍基本未被探索。本文提出了T2O定位任务,其旨在从文本场景描述中估算城市环境中的准确二维位置,而无需依赖几何观测或基于GNSS的初始位置。为支持本任务,我们引入TOL,一个跨越多个大陆和多样化城市环境的大规模基准数据集。TOL包含约 121K 条文本查询与OSM地图瓦片配对,覆盖约 316 km 的道路轨迹,涵盖波士顿、卡尔斯鲁厄和新加坡。我们进一步提出TOLoc,一个从粗到细的定位框架,显式建模周围物体的语义及其方向信息。在粗阶段,提取文本描述和OSM瓦片中的方向感知特征,以构建全局描述符,用于检索查询的候选位置。在细阶段,对查询文本和顶部1个检索瓦片进行联合处理,其中专门的对齐模块融合文本描述符和局部地图特征,以回归二维两自由度姿态。实验结果表明,TOLoc 在 5 m、10 m 和 25 m 阈值下分别优于最佳现有方法提高了 6.53%、9.93% 和 8.32%,并显示出对未见环境的强大泛化能力。数据集、代码和模型将在 https://github.com/WHU-USI3DV/TOL 上公开。
引用
@article{arxiv.2604.01644,
title = {TOL: Textual Localization with OpenStreetMap},
author = {Youqi Liao and Shuhao Kang and Jingyu Xu and Olaf Wysocki and Yan Xia and Jianping Li and Zhen Dong and Bisheng Yang and Xieyuanli Chen},
journal= {arXiv preprint arXiv:2604.01644},
year = {2026}
}
备注
Tech repo