SynopticBench:评估生成天气预报讨论的视觉语言模型
计算与语言
2026-04-21 v1 计算机视觉与模式识别
机器学习
大气与海洋物理
摘要
近期视觉语言模型(VLMs)的进展显著提升了诸多复杂多模态任务,如图像描述、报告生成和视觉感知。然而,生成来自气象数据的文本极具挑战性,因为大气是一种在各种空间和时间尺度上快速变化的混沌系统。鉴于大气现象的复杂性,关键的是可验证地量化现有VLMs在天气预报数据上的效果。本 work提出了SynopticBench,一个由1,367,041个文本样本组成的高质量数据集,包含来自美国全国气象局(National Weather Service)的区域气象讨论(Area Forecast Discussions)的文本,配有500mb地势高度、2米温度和850mb风速气象预报图像。我们还提出了Synoptic Phenomena Alignment and Coverage Evaluation(SPACE),一种可有效估计气象现象文本描述质量的新评估框架。对使用最先进VLMs生成气象预报讨论的广泛实验显示,现有评估指标在该领域的灵敏性,并为进一步探索气象和气候文本生成提供了可能性。
引用
@article{arxiv.2604.16451,
title = {SynopticBench: Evaluating Vision-Language Models on Generating Weather Forecast Discussions of the Future},
author = {Timothy B. Higgins and Antonios Mamalakis and Chirag Agarwal},
journal= {arXiv preprint arXiv:2604.16451},
year = {2026}
}
备注
Accepted for presentation at Climate Informatics 2026