DisasterM3:用于灾害损毁评估与响应的遥感视觉语言数据集
计算机视觉与模式识别
2025-10-22 v2
摘要
大型视觉语言模型在地球视觉领域取得了巨大成就。然而,具有多种灾害类型、地理区域和卫星传感器的复杂灾害场景对 VLM 的应用提出了新的挑战。为了填补这一空白,我们为全球规模的灾害评估与响应整理了一个遥感视觉语言数据集(DisasterM3)。DisasterM3 包含横跨 5 大洲的 26,988 张双时相卫星图像和 123k 个指令对,具有三个特点:1) 多灾种:DisasterM3 涉及 36 个具有重大影响的历史灾害事件,将其分为 10 种常见的自然和人为灾害。2) 多传感器:灾害期间的极端天气通常阻碍光学传感器成像,这使得结合合成孔径雷达(SAR)图像进行灾后场景分析成为必要。3) 多任务:基于真实世界场景,DisasterM3 包含 9 个与灾害相关的视觉感知与推理任务,充分发挥了 VLM 的推理能力,从承灾体识别到结构损毁评估和目标关系推理,最终生成灾害长篇报告。我们在我们的基准上广泛评估了 14 个通用和遥感 VLM,结果表明 state-of-the-art 模型在灾害任务上面临困难,这主要是由于缺乏特定于灾害的语料库、跨传感器差距以及对损毁目标计数的不敏感性。针对这些问题,我们使用我们的数据集对四个 VLM 进行了微调,并在所有任务上取得了稳定的提升,具有稳健的跨传感器和跨灾害泛化能力。代码和数据可在以下地址获取:https://github.com/Junjue-Wang/DisasterM3。
引用
@article{arxiv.2505.21089,
title = {DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response},
author = {Junjue Wang and Weihao Xuan and Heli Qi and Zhihao Liu and Kunyi Liu and Yuhan Wu and Hongruixuan Chen and Jian Song and Junshi Xia and Zhuo Zheng and Naoto Yokoya},
journal= {arXiv preprint arXiv:2505.21089},
year = {2025}
}
备注
A multi-hazard, multi-sensor, and multi-task vision-language dataset for global-scale disaster assessment and response