面向热带气旋防范的多模态大型语言模型基准测试 CyPortQA
计算与语言
2025-11-17 v2
摘要
随着热带气旋的加剧和路径预测越来越不确定,美国港口面临在极端天气条件下的供应链风险增加。港口运营商需要快速综合多样化的预测产品,如概率风力图、路径锥和官方建议,生成清晰可行动的指导作为气旋接近。多模态大型语言模型 (Multimodal Large Language Models, MLLMs) 提供了一种强大的手段,用于整合这些异构数据源以及更广泛的背景知识,但其在热带气旋防范特定语境下的准确性和可靠性尚未得到严格评估。为填补这一空白,我们引入 CyPortQA,这是首个针对气旋威胁下港口运营的多模态基准测试。CyPortQA 汇集了 2015 年至 2023 年的 2,917 个真实世界场景,覆盖 145 个美国主要港口和 90 个命名气旋。每个场景融合多源数据(即热带气旋产品、港口运营影响记录和港口状况公告),并通过自动化管道扩展为 117,178 条结构化问答对。使用该基准,我们对 diverse MLLMs 进行大规模实验,包括开源和专有模型。MLLMs 在情境理解方面显示出巨大的潜力,但在推理任务中仍面临诸多挑战,包括潜在影响估计和决策推理等。
引用
@article{arxiv.2508.15846,
title = {CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation},
author = {Chenchen Kuai and Chenhao Wu and Yang Zhou and Xiubin Bruce Wang and Tianbao Yang and Zhengzhong Tu and Zihao Li and Yunlong Zhang},
journal= {arXiv preprint arXiv:2508.15846},
year = {2025}
}
备注
9 pages, 5 figures