中文

评估视觉语言模型的精确地理位置推理能力

计算机视觉与模式识别 2025-02-21 v1 密码学与安全 机器学习

摘要

视觉语言模型 (Vision-Language Models, VLM) 的流行在视觉信息日益可得的时代引发了关于隐私的重要问题。虽然基础 VLM 展示了广泛的知识和学习能力,但我们特别关注其从先前未见过的图像数据中推断地理位置的能力。本文引入了一个来自 Google Street View 的基准数据集,代表其全球覆盖分布。对基础模型进行单图像地理位置推理评估,许多模型实现了小于 300 km 的中位数距离误差。我们进一步评估了具备补充工具的 VLM "代理人",观察到距离误差降低了最高 30.6%。我们的发现表明,现代基础 VLM 可作为强大的图像地理位置工具,无需专门训练即可实现此功能。当这些模型的可获取性日益增加时,我们的发现对在线隐私具有更大的含义。我们讨论了这些风险以及此领域的未来工作。

关键词

引用

@article{arxiv.2502.14412,
  title  = {Evaluating Precise Geolocation Inference Capabilities of Vision Language Models},
  author = {Neel Jay and Hieu Minh Nguyen and Trung Dung Hoang and Jacob Haimes},
  journal= {arXiv preprint arXiv:2502.14412},
  year   = {2025}
}

备注

AAAI 2025 Workshop DATASAFE