中文

WeatherArchive-Bench:用于历史天气档案检索增强推理的基准

计算与语言 2026-04-21 v2 人工智能

摘要

历史档案中的天气事件是持久的原始记录集合,提供丰富、尚未充分挖掘的叙述,说明社会如何经历和应对极端天气事件。这些定性叙述提供关于社会脆弱性和韧性的见解,这些见解在气象记录中几乎不存在,使其对气候科学家理解社会反应具有重要价值。然而,这些档案的规模庞大、数字化质量嘈杂且语言陈旧,使其难以转化为气候研究的结构化知识。为此,我们引入 WeatherArchive-Bench,第一个用于评估检索增强生成(RAG)系统在历史天气档案中的表现的基准。WeatherArchive-Bench 包含两个任务:WeatherArchive-Retrieval 测量系统从超过一百万个档案新闻片段中定位历史相关片段的能力;WeatherArchive-Assessment 评估大语言模型(LLM)是否能够从极端天气叙述中对社会脆弱性和韧性指标进行分类。广泛的实验包括稀疏、密集和重新排序检索器,以及多样化的 LLM,揭示密集检索器在历史术语方面常常失败,LLM 常常误解脆弱性和韧性概念。这些发现凸显了关于复杂社会指标推理的关键局限性,并为从档案背景设计更稳健的气候聚焦 RAG 系统提供了见解。构建的数据集和评估框架已公开于 https://anonymous.4open.science/r/WeatherArchive-Bench/。

关键词

引用

@article{arxiv.2510.05336,
  title  = {WeatherArchive-Bench: Benchmarking Retrieval-Augmented Reasoning for Historical Weather Archives},
  author = {Yongan Yu and Xianda Du and Qingchen Hu and Jiahao Liang and Jingwei Ni and Dan Qiang and Kaiyu Huang and Grant McKenzie and Renee Sieber and Fengran Mo},
  journal= {arXiv preprint arXiv:2510.05336},
  year   = {2026}
}

备注

accepted to the Resource Track of SIGIR 2026