从像素到语义:面向卫星图像结构性损伤检测的多阶段人工智能框架
计算机视觉与模式识别
2026-04-08 v1
摘要
快速准确的结构性损伤评估对于有效的紧急响应和恢复至关重要。然而,遥感图像常因分辨率不足、语境模糊和语义可解释性有限而降低传统检测流程的可靠性。本文提出一种新型混合框架,集成基于人工智能的超分辨率、深度学习目标检测和视觉语言模型(Vision-Language Models, VLMs),实现综合性灾后建筑损伤评估。首先,我们采用视频恢复变换器(Video Restoration Transformer, VRT)增强灾前灾后卫星图像,将分辨率从 1024x1024 提升至 4096x4096,提高结构细节可见度。随后,基于 YOLOv11 的检测器在灾前图像中定位建筑物,并对裁剪后的建筑区域使用 VLMs 进行语义化损伤评估,覆盖四个损伤严重程度等级。为解决缺乏真实答案 captions 时的评估问题,我们采用 CLIPScore 实现参考无关的语义对齐,并引入多模型 VLM-作为-评判策略以减少单一模型偏差,提升安全关键决策的可靠性。在 xBD 数据集的子集上进行实验,包括 Moore 龙卷风和 Hurricane Matthew 事件,结果表明所提框架显著增强了受损建筑的语义解释。此外,框架根据损伤分析提供实用建议,帮助应急人员制定后续恢复方案。
引用
@article{arxiv.2603.22768,
title = {From Pixels to Semantics: A Multi-Stage AI Framework for Structural Damage Detection in Satellite Imagery},
author = {Bijay Shakya and Catherine Hoier and Khandaker Mamun Ahmed},
journal= {arXiv preprint arXiv:2603.22768},
year = {2026}
}