Img2Loc:基于多模态基础模型与基于图像的检索增强生成重新审视图像地理定位
计算机视觉与模式识别
2024-07-31 v1 人工智能
摘要
从图像中定位精确位置是计算机视觉和信息检索中的一个挑战性问题。传统方法通常采用分类或检索方法:前者将地球表面划分为网格单元并据此对图像进行分类,后者通过将图像与图像-位置对数据库进行匹配来识别位置。然而,基于分类的方法受限于网格单元大小,无法给出精确预测;而基于检索的系统通常搜索质量较差,且在不同尺度和聚合水平上对全球景观的覆盖不足。为了克服这些缺陷,我们提出了 Img2Loc,一个将图像地理定位重新定义为文本生成任务的新系统。这是通过使用诸如 GPT4V 或 LLaVA 等前沿大型多模态模型结合检索增强生成来实现的。Img2Loc 首先采用基于 CLIP 的表示来生成基于图像的坐标查询数据库。然后,它独特地将查询结果与图像本身结合,形成专为 LMM 定制的精细提示。在 Im2GPS3k 和 YFCC4k 等基准数据集上进行测试时,Img2Loc 不仅超越了先前 SOTA 模型的性能,而且无需任何模型训练。
引用
@article{arxiv.2403.19584,
title = {Img2Loc: Revisiting Image Geolocalization using Multi-modality Foundation Models and Image-based Retrieval-Augmented Generation},
author = {Zhongliang Zhou and Jielu Zhang and Zihan Guan and Mengxuan Hu and Ni Lao and Lan Mu and Sheng Li and Gengchen Mai},
journal= {arXiv preprint arXiv:2403.19584},
year = {2024}
}