中文

群智能在地理定位中的应用:基于多智能体的大视觉语言模型协同框架

计算机视觉与模式识别 2024-10-16 v3 人工智能

摘要

视觉地理定位要求深入的知识和高级推理能力,以将图像与精确的真实世界地理位置关联。现有的图像数据库检索方法受到存储全球地标足够视觉记录的不切实际性的限制。最近,大视觉语言模型(LVLMs)通过视觉问答(VQA)展示了地理定位能力,实现了一种无需外部地理标记图像记录的解决方案。然而,单个LVLM的性能仍受其内在知识和推理能力的限制。为应对这些挑战,我们提出了smileGeo,这是一个新颖的视觉地理定位框架,利用多个联网的LVLM智能体在基于智能体的架构中运行。通过促进智能体间通信,smileGeo将这些智能体的固有知识与额外检索到的信息整合,增强了有效定位图像的能力。此外,我们的框架包含一种动态学习策略,优化智能体通信,减少冗余交互并提升整体系统效率。为验证所提框架的有效性,我们在三个不同数据集上进行了实验,结果表明我们的方法显著优于当前最先进方法。源代码可在 https://anonymous.4open.science/r/ViusalGeoLocalization-F8F5 获取。

关键词

引用

@article{arxiv.2408.11312,
  title  = {Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework},
  author = {Xiao Han and Chen Zhu and Xiangyu Zhao and Hengshu Zhu},
  journal= {arXiv preprint arXiv:2408.11312},
  year   = {2024}
}

备注

resubmit to www2025