中文

Recov-Vision:将街景影像与视觉语言模型关联用于灾后恢复

计算机视觉与模式识别 2026-02-05 v2

摘要

灾后建筑层级占用情况对于急救、检查、能源重新激活和公平资源分配至关重要。空中影像提供快速覆盖但常常遗漏建筑立面和通道线索,这些线索决定居住性,而街景影像捕获这些细节但稀疏且难以与地块对齐。我们提出了 FacadeTrack,一个基于语言引导的街级框架,将全景视频链接到地块,校正视角以建筑立面,并提取可解释属性(例如入口阻塞、临时覆盖、局部碎片),驱动两种决策策略:一种透明的单阶段规则,一种将感知与保守推理分离的两阶段设计。在两次风灾后调查中评估,两种阶段方法的精确率为 0.927,召回率为 0.781,F1 分数为 0.848,与单阶段基线相比分别为 0.943、0.728、0.822。除了准确度外,中间属性和空间诊断揭示了残差错误发生的具体位置和原因,实现有针对性的质量控制。该管道提供可审计、可扩展的占用评估,适合集成到地理信息和应急管理工作流程中。

关键词

引用

@article{arxiv.2509.20628,
  title  = {Recov-Vision: Linking Street View Imagery and Vision-Language Models for Post-Disaster Recovery},
  author = {Yiming Xiao and Archit Gupta and Miguel Esparza and Yu-Hsuan Ho and Antonia Sebastian and Hannah Weas and Rose Houck and Ali Mostafavi},
  journal= {arXiv preprint arXiv:2509.20628},
  year   = {2026}
}

备注

20 pages, 10 figures