中文

LLM 智能体能响应灾害吗?基准测试应急行动中的异构地理空间推理

人工智能 2026-05-13 v1

摘要

可操作的灾害响应超越了损害评估,要求响应者整合多传感器信号,对路网、人口和关键设施进行推理,规划疏散,并生成可执行的报告。然而,先前的工作大多孤立地处理遥感感知或评估通用的工具使用,导致应急行动端到端工作流的探索不足。本文介绍灾害行动响应智能体基准(DORA),这是首个用于端到端灾害响应的智能体基准:包含 515 个由专家编写的任务,涵盖 45 个真实世界灾害事件、10 种灾害类型,并配有专家验证、可复现的黄金轨迹,总计 3500 个工具调用步骤。任务涵盖五个维度,覆盖了可操作的灾害响应流程:灾害感知、空间关系分析、救援与疏散规划、时间演化推理以及多模态报告合成。智能体通过一个包含 108 个工具的 MCP 库,在异构地理空间数据上组合调用:包括单时相、双时相和多时相序列(0.015-10m GSD)的光学、SAR 和多光谱影像,并辅以高程和社会矢量图层。我们在基准上全面评估了 13 个前沿 LLMs,揭示了三个持续存在的挑战:1)灾害领域基础暴露了独特的失败模式(灾害语义基础、传感器模态不匹配和灾害流程组合);2)智能体受到工具选择和参数基础的双重瓶颈限制,其中黄金工具顺序提示仅能将准确率提高 1.08-4.40%,而替代框架最多只能带来 3.24% 的提升;3)组合脆弱性随轨迹长度增加而加剧,智能体与黄金轨迹的差距在长流程上从 7% 扩大到 56%。DORA 为构建操作可靠的灾害响应智能体建立了一个严格的测试平台。

关键词

引用

@article{arxiv.2605.11633,
  title  = {Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations},
  author = {Junjue Wang and Weihao Xuan and Heli Qi and Pengyu Dai and Kunyi Liu and Hongruixuan Chen and Zhuo Zheng and Junshi Xia and Stefano Ermon and Naoto Yokoya},
  journal= {arXiv preprint arXiv:2605.11633},
  year   = {2026}
}

备注

DORA stress-tests LLM agents on real-world disaster operations that demand comprehensive orchestration of 108 specialized tools over heterogeneous geospatial data