DamageArbiter:基于 CLIP 增强的多模态仲裁框架,用于从街景图像进行风灾损伤评估
计算机视觉与模式识别
2026-03-17 v1
摘要
使用计算机视觉模型分析街景图像进行快速、局部的损伤评估正在变得流行且在紧急响应和恢复中具有重要价值,但传统模型常常像黑箱一样,缺乏可解释性和可靠性。本研究提出了一种由对比语言-图像预训练(CLIP)模型驱动的多模态不一致驱动的仲裁框架,称为 DamageArbiter,以提高从街景图像进行损伤估计的准确性、可解释性和鲁棒性。DamageArbiter 利用单模态和多模态模型的互补优势,采用轻量级逻辑回归元分类器进行仲裁。使用 2,556 张事后灾后街景图像,配有手动生成和大语言模型(LLM)生成的文本描述,我们系统比较了单模态模型(包括仅图像模型和仅文本模型)、基于 CLIP 的多模态模型和 DamageArbiter。值得注意的是,DamageArbiter 将准确率从 74.33%(ViT-B/32,仅图像)提高到 82.79%,超越 80% 的准确率阈值,相对于最强的基线模型提高了 8.46%。除了整体准确性的提高之外,与仅依赖图像的视觉模型相比,DamageArbiter 通过仲裁单模态和多模态预测之间的差异,缓解了视觉模型在灾后视觉线索模糊或受干扰时常见的过度自信错误,尤其是减少了过度自信但错误的预测。我们进一步绘制并分析了地理引用的预测和误分类,以比较不同位置的模型性能。总体而言,本工作将街景基于灾害的评估从粗糙的严重程度分类推进 toward 更可靠和可解释的框架。
引用
@article{arxiv.2603.14837,
title = {DamageArbiter: A CLIP-Enhanced Multimodal Arbitration Framework for Hurricane Damage Assessment from Street-View Imagery},
author = {Yifan Yang and Lei Zou and Wenjing Gong and Kani Fu and Zongrong Li and Siqin Wang and Bing Zhou and Heng Cai and Hao Tian},
journal= {arXiv preprint arXiv:2603.14837},
year = {2026}
}