中文

SynopticBench:评估生成天气预报讨论的视觉语言模型

计算与语言 2026-04-21 v1 计算机视觉与模式识别 机器学习 大气与海洋物理

摘要

近期视觉语言模型(VLMs)的进展显著提升了诸多复杂多模态任务,如图像描述、报告生成和视觉感知。然而,生成来自气象数据的文本极具挑战性,因为大气是一种在各种空间和时间尺度上快速变化的混沌系统。鉴于大气现象的复杂性,关键的是可验证地量化现有VLMs在天气预报数据上的效果。本 work提出了SynopticBench,一个由1,367,041个文本样本组成的高质量数据集,包含来自美国全国气象局(National Weather Service)的区域气象讨论(Area Forecast Discussions)的文本,配有500mb地势高度、2米温度和850mb风速气象预报图像。我们还提出了Synoptic Phenomena Alignment and Coverage Evaluation(SPACE),一种可有效估计气象现象文本描述质量的新评估框架。对使用最先进VLMs生成气象预报讨论的广泛实验显示,现有评估指标在该领域的灵敏性,并为进一步探索气象和气候文本生成提供了可能性。

关键词

引用

@article{arxiv.2604.16451,
  title  = {SynopticBench: Evaluating Vision-Language Models on Generating Weather Forecast Discussions of the Future},
  author = {Timothy B. Higgins and Antonios Mamalakis and Chirag Agarwal},
  journal= {arXiv preprint arXiv:2604.16451},
  year   = {2026}
}

备注

Accepted for presentation at Climate Informatics 2026