WeatherQA:多模态语言模型能否推理强对流天气?
人工智能
2024-06-25 v2 计算与语言
计算机视觉与模式识别
大气与海洋物理
摘要
强对流天气事件,如冰雹、龙卷风和雷暴,通常发生迅速但造成巨大破坏,每年损失数十亿美元。这凸显了提前数小时预报强对流天气威胁的重要性,以便更好地帮助处于风险区域的预报员和居民做好准备。现代大型基础模型能否执行此类预报?现有的天气基准通常仅关注预测某些天气参数(如温度、湿度)的时间序列变化,且仅使用文本特征。在这项工作中,我们引入了WeatherQA,这是第一个多模态数据集,旨在让机器推理天气参数的复杂组合(即要素)并预测现实场景中的强对流天气。该数据集包含超过8000个(多图像、文本)对,涵盖多种强对流天气事件。每对包含对预报至关重要的丰富信息——图像描述了捕捉环境不稳定性、地面观测和雷达反射率的要素,文本则包含人类专家撰写的预报分析。利用WeatherQA,我们通过设计两个具有挑战性的任务来评估最先进的视觉语言模型,包括GPT4、Claude3.5、Gemini-1.5以及微调后的基于Llama3的VLM:(1) 用于预测受影响区域的多选题问答;(2) 强对流发展潜力的分类。这些任务需要对领域知识(如大气动力学)的深入理解以及对多模态数据(如天气参数之间的相互作用)的复杂推理。我们展示了最强VLM(GPT4o)与人类推理之间的显著差距。我们与气象学家进行的综合案例研究进一步揭示了模型的弱点,表明需要更好的训练和数据集成来弥合这一差距。WeatherQA链接:https://github.com/chengqianma/WeatherQA。
引用
@article{arxiv.2406.11217,
title = {WeatherQA: Can Multimodal Language Models Reason about Severe Weather?},
author = {Chengqian Ma and Zhanxiang Hua and Alexandra Anderson-Frey and Vikram Iyer and Xin Liu and Lianhui Qin},
journal= {arXiv preprint arXiv:2406.11217},
year = {2024}
}
备注
26 pages, 9 figures