中文

擅长描述,不擅长计数:在地球观测数据上对 GPT-4V 的基准测试

计算与语言 2024-02-01 v1 人工智能 计算机视觉与模式识别

摘要

大型视觉语言模型在涉及视觉输入和自然语言指令的复杂任务中展现出了令人印象深刻的性能。然而,这些在自然图像上的能力在多大程度上能迁移到地球观测(EO)数据上仍不清楚,后者主要是卫星和航空图像,在 VLM 训练数据中较少见。在这项工作中,我们提出了一个全面的基准测试,通过评估 VLM 在场景理解、定位与计数以及变化检测任务上的能力,来衡量其在成为 EO 数据有用工具方面的进展。受实际应用的启发,我们的基准测试包含了城市监测、灾害救援、土地利用和生态保护等场景。我们发现,尽管像 GPT-4V 这样的最先进 VLM 拥有广泛的世界知识,使其在位置理解和图像描述等开放式任务上表现优异,但其较差的空间推理能力限制了其在目标定位和计数任务上的实用性。我们的基准测试将在 https://vleo.danielz.ch/ 和 Hugging Face 的 https://huggingface.co/collections/mit-ei/vleo-benchmark-datasets-65b789b0466555489cce0d70 上公开发布,以便于模型评估。

关键词

引用

@article{arxiv.2401.17600,
  title  = {Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data},
  author = {Chenhui Zhang and Sherrie Wang},
  journal= {arXiv preprint arXiv:2401.17600},
  year   = {2024}
}

备注

62 pages; work in progress