中文

利用大型视觉语言模型进行基于图像的地理定位

密码学与安全 2024-08-20 v1 计算与语言 计算机视觉与模式识别

摘要

地理定位现在是现代生活的重要组成部分,提供众多益处但也带来严重的隐私问题。具有先进图像处理能力的大型视觉语言模型(LVLMs)的出现引入了新的风险,因为这些模型可能无意中泄露敏感的地理位置信息。本文首次深入分析了传统深度学习和基于LVLM的地理定位方法所带来的挑战。我们的发现表明,LVLMs即使没有明确的地理训练,也能从图像中准确地确定地理位置。为了应对这些挑战,我们引入了 \tool{},这是一个创新框架,显著提高了基于图像的地理定位准确性。\tool{} 采用系统性的思维链(CoT)方法,模仿人类地理猜测策略,通过仔细分析视觉和上下文线索(如车辆类型、建筑风格、自然景观和文化元素)来进行定位。在50,000个真实数据点的数据集上进行的大量测试表明,\tool{} 在准确性方面优于传统模型和人类基准。它在 GeoGuessr 游戏中取得了令人印象深刻的平均得分4550.5,胜率为85.37%,并提供了高度精确的地理位置预测,最近距离准确到0.3公里。此外,我们的研究强调了与数据集完整性相关的问题,导致了更健壮数据集的创建和一个利用LVLMs认知能力来提高地理定位精度的改进框架。这些发现强调了\tool{}在解释复杂视觉数据方面的卓越能力、应对LVLMs带来的新兴安全漏洞的紧迫性,以及确保用户隐私保护的负责任AI开发的重要性。

关键词

引用

@article{arxiv.2408.09474,
  title  = {Image-Based Geolocation Using Large Vision-Language Models},
  author = {Yi Liu and Junchen Ding and Gelei Deng and Yuekang Li and Tianwei Zhang and Weisong Sun and Yaowen Zheng and Jingquan Ge and Yang Liu},
  journal= {arXiv preprint arXiv:2408.09474},
  year   = {2024}
}