基于自然语言描述的跨视图地理定位
计算机视觉与模式识别
2025-04-02 v2
摘要
跨视图地理定位通过将街景图像与带有地理标签的卫星图像或 OSM 进行匹配来识别图像位置。然而,大多数现有研究聚焦于图像到图像的检索,忽略了以文本为导向的检索,这对于行人导航和紧急响应等应用至关重要。本文引入了一种新任务,即基于自然语言描述的跨视图地理定位,旨在根据场景文本描述检索相应的卫星图像或 OSM 数据库。为支持该任务,我们构建了 CVG-Text 数据集,通过收集多个城市的跨视图数据并采用利用大型多模态模型注释能力生成高质量场景文本描述(包含定位细节)的方法。此外,我们提出了一种新颖的文本基检索定位方法 CrossText2Loc,该方法在召回率上提升了 10%,并展现出卓越的长文本检索能力。就可解释性而言,它不仅提供相似度得分,还提供检索原因。更多信息请参见 https://yejy53.github.io/CVG-Text/。
引用
@article{arxiv.2412.17007,
title = {Where am I? Cross-View Geo-localization with Natural Language Descriptions},
author = {Junyan Ye and Honglin Lin and Leyan Ou and Dairong Chen and Zihao Wang and Qi Zhu and Conghui He and Weijia Li},
journal= {arXiv preprint arXiv:2412.17007},
year = {2025}
}
备注
11 pages, 6 figures