DisasterInsight:面向功能感知与基于事实的灾害评估的多模态基准
计算机视觉与模式识别
2026-01-27 v1
摘要
及时解读卫星图像对灾害响应至关重要,然而现有的遥感视觉语言基准主要关注粗粒度标签和图像级识别,忽略了现实人道主义工作流中所需的功能理解和指令鲁棒性。我们引入了 DisasterInsight,这是一个旨在评估视觉语言模型(VLM)在现实灾害分析任务上表现的多模态基准。DisasterInsight 将 xBD 数据集重构为约 112K 个以建筑物为中心的实例,并支持跨多个任务的指令多样化评估,包括建筑功能分类、损坏等级与灾害类型分类、计数以及与人道主义评估指南对齐的结构化报告生成。为了建立领域适应的基线,我们提出了 DI-Chat,通过使用参数高效的低秩适应(LoRA)在灾害特定指令数据上微调现有 VLM 主干获得。在 SOTA 通用与遥感 VLM 上的大量实验揭示了跨任务的显著性能差距,特别是在损坏理解和结构化报告生成方面。DI-Chat 在损坏等级与灾害类型分类以及报告生成质量上取得了显著提升,而建筑功能分类对所有评估模型仍具挑战性。DisasterInsight 为研究灾害图像中基于事实的多模态推理提供了统一基准。
引用
@article{arxiv.2601.18493,
title = {DisasterInsight: A Multimodal Benchmark for Function-Aware and Grounded Disaster Assessment},
author = {Sara Tehrani and Yonghao Xu and Leif Haglund and Amanda Berg and Michael Felsberg},
journal= {arXiv preprint arXiv:2601.18493},
year = {2026}
}
备注
Under review at ICPR 2026