中文

TimeSpot:面向视觉语言模型的地理时空理解基准测试

计算机视觉与模式识别 2026-05-26 v2 计算与语言 新兴技术 多媒体 机器人学

摘要

地理时空理解,即仅从视觉输入推断位置、时间和上下文属性的能力,支撑着灾害管理、交通规划、具身导航、世界建模和地理教育等应用。虽然最近的视觉语言模型(VLMs)在利用地标和路标等线索实现图像地理定位方面取得了进展,但其在推理时序信号和物理依托空间线索方面的能力仍有限。为此,我们提出TimeSpot,这是一个用于评估VLMs在真实世界中地理时空理解的基准测试。TimeSpot包含来自80个国家的1,455张地面图像,要求直接从视觉证据结构化预测时序属性(季节、月份、一天中的时间、日照阶段)和地理属性(大洲、国家、气候带、环境类型、纬度-经度)。它还包括测试物理合理性下的空间时序推理任务。VLMs的状态-of-the-art开放式和封闭式模型评估显示表现较差,尤其是时序推理。虽然监督式微调可获得改进,但结果仍不足以实现稳健、物理依托的地理时空理解。TimeSpot 可在 https://TimeSpot-GT.github.io 获取。

关键词

引用

@article{arxiv.2603.06687,
  title  = {TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings},
  author = {Azmine Toushik Wasi and Shahriyar Zaman Ridoy and Koushik Ahamed Tonmoy and Kinga Tshering and S. M. Muhtasimul Hasan and Wahid Faisal and Tasnim Mohiuddin and Md Rizwan Parvez},
  journal= {arXiv preprint arXiv:2603.06687},
  year   = {2026}
}

备注

Accepted to ICML 2026