基于视觉语言模型的多视角地面图像野火损伤自动评估
计算机视觉与模式识别
2026-04-07 v2
摘要
野火的强度和频率不断增加,亟需创新的计算方法进行快速准确的财产损伤评估。传统方法往往耗时,而现代计算机视觉方法通常需要大量标记数据集,阻碍了灾后即时部署。本研究引入一种新颖的零样例框架,利用预训练的多模态大语言模型(MLLM)对地面图像进行损伤分类。以Generative Pre-trained Transformer 4o(GPT-4o)为主要模型,并与Qwen2.5-Vision-Language-32-Billion-Instruct(Qwen)进行比较验证,研究评估了应用于加州2025年Eaton和Palisades火灾的两个管道。这些管道包括端到端推理方法(管道A)和视觉线索驱动文本分类的解耦式工作流程(管道B)。本研究的主要贡献之一是展示了MLLM在从多个视角综合信息方面的有效性。研究结果表明,单视图评估在分类中间损伤方面难以实现,而多视图分析可显著改善。为探讨提示方法的影响,研究将基线零样例和启发式方法与先进推理策略(结构化链式思考和自我一致性)进行基准测试。结果表明,简单的提示方法可实现与推理策略相当的准确率。
引用
@article{arxiv.2509.01895,
title = {Automated Wildfire Damage Assessment from Multi view Ground level Imagery Via Vision Language Models},
author = {Miguel Esparza and Archit Gupta and Kai Yin and Yiming Xiao and Ali Mostafavi},
journal= {arXiv preprint arXiv:2509.01895},
year = {2026}
}