中文

基于 AI 超分辨率与视觉语言模型的结构损伤检测

计算机视觉与模式识别 2026-03-17 v1

摘要

自然灾害由于其突发性和涉及的范围广泛,对及时和准确的损伤评估构成重大挑战。传统评估方法往往需要大量人力、成本高昂,且对人员安全构成风险,难以应用于快速响应,尤其是在资源受限的环境中。本研究提出一种新型、具有成本效益的框架,利用无人机航拍 footage,结合先进的基于 AI 的视频超分辨率模型 Video Restoration Transformer (VRT) 以及 270 亿参数的视觉语言模型 (VLM) Gemma3:27b。该集成系统旨在提高低分辨率灾难 footage 的质量,识别结构性损伤,并将建筑物分类为四个损伤类别,从无/轻微损伤到完全倒塌,以及相关风险等级。该方法使用 2023 年土耳其地震(感谢 The Guardian 提供)和 2013 年 Moore 龙卷风(xBD 数据集)中的前后事件无人机影像和卫星数据进行验证。该框架实现了 84.5% 的分类准确率,证明其能够提供高度准确的结果。此外,系统的可访问性允许非技术用户执行初步分析,从而提高灾害管理 efforts 的响应速度和效率。

关键词

引用

@article{arxiv.2508.17130,
  title  = {Structural Damage Detection Using AI Super Resolution and Visual Language Model},
  author = {Catherine Hoier and Khandaker Mamun Ahmed},
  journal= {arXiv preprint arXiv:2508.17130},
  year   = {2026}
}