中文

GAEA:地理定位感知对话助手

计算机视觉与模式识别 2025-09-04 v3 机器学习

摘要

图像地理定位是一项具有诸多下游应用的挑战性任务,传统上由 AI 模型预测图像的精确 GPS 坐标。然而,用户无法利用该模型在 GPS 坐标之外进一步获取知识;该模型缺乏对位置的理解以及与用户交流的对话能力。近期,随着大型多模态模型(LMMs)——包括专有和开源模型——的巨大进步,研究人员尝试通过 LMMs 进行图像地理定位。然而,这些问题仍未解决;在一般任务之外,对于更专业的下游任务(如地理定位),LMMs 依然面临困难。在这项工作中,我们通过引入一个对话模型 GAEA 来解决这一问题,该模型可根据用户需求提供关于图像位置的信息。目前不存在能够训练此类模型的大规模数据集。因此,我们提出了 GAEA-1.4M,一个包含超过 80 万张图像和约 140 万个问答对的综合数据集,该数据集利用 OpenStreetMap (OSM) 属性和地理上下文线索构建而成。为了进行定量评估,我们提出了一个多样化的基准 GAEA-Bench,包含 3.5k 个图像-文本对,用于评估配备多样化问题类型的对话能力。我们考虑了 11 个 SOTA 的开源和专有 LMMs,并证明 GAEA 显著优于最佳开源模型 LLaVA-OneVision 18.2%,优于最佳专有模型 GPT-4o 7.2%。我们的数据集、模型和代码均已公开。

关键词

引用

@article{arxiv.2503.16423,
  title  = {GAEA: A Geolocation Aware Conversational Assistant},
  author = {Ron Campos and Ashmal Vayani and Parth Parag Kulkarni and Rohit Gupta and Aizan Zafar and Aritra Dutta and Mubarak Shah},
  journal= {arXiv preprint arXiv:2503.16423},
  year   = {2025}
}

备注

The dataset and code used in this submission is available at: https://ucf-crcv.github.io/GAEA/