开拓新领域:探索多模态大语言模型的地理与地理空间能力
计算机视觉与模式识别
2024-01-17 v3 人工智能
摘要
多模态大语言模型(MLLMs)已在广泛任务中展现出卓越能力,尽管其在导航、环境研究、城市发展与灾害响应方面具有潜在广泛益处,它们在地理与地理空间领域的知识与能力仍有待探索。我们进行了一系列实验,探究此类领域中 MLLMs 的多种视觉能力,特别关注前沿模型 GPT-4V,并将其性能与开源同类模型进行基准比较。我们的方法以一套小型地理基准挑战这些模型,该基准由一组视觉任务构成,测试它们跨越不同复杂度的能力。分析不仅揭示了此类模型的优势所在(包括其超越人类的实例),也揭示了其弱点,从而对其在地理领域的能力给出均衡看法。为便于未来模型的比较与评估,我们的基准将公开发布。
引用
@article{arxiv.2311.14656,
title = {Charting New Territories: Exploring the Geographic and Geospatial Capabilities of Multimodal LLMs},
author = {Jonathan Roberts and Timo Lüddecke and Rehan Sheikh and Kai Han and Samuel Albanie},
journal= {arXiv preprint arXiv:2311.14656},
year = {2024}
}
备注
V3: Fixed typo in Fig.1; V2: Minor formatting changes and added missing subfigure captions