Recov-Vision:将街景影像与视觉语言模型关联用于灾后恢复
机器学习
2025-09-26 v1 人工智能
摘要
灾后建筑层级占用情况对于分诊、检查、电力恢复以及公平资源分配至关重要。俯瞰影像提供快速覆盖,但常常遗漏建筑立面和通道线索,这些线索决定建筑的可居住性;而街景影像捕获这些细节,但稀疏且难以与地块对齐。我们提出了FacadeTrack,一个基于语言引导的街级框架,将全景视频与地块关联,校正视角以建筑立面,并提取可解释属性(例如入口阻塞、临时覆盖、局部碎石),驱动两种决策策略:一种是透明的单阶段规则,另一种是分离感知与保守推理的两阶段设计。在两个灾后海伈尔纳(Hurricane Helene)调查中,两阶段方法实现了0.927的精确率、0.781的召回率和0.848的F-1分数,与单阶段基线相比分别为0.943的精确率、0.728的召回率和0.822的F-1分数。除了准确率外,中间属性和空间诊断揭示了残差错误的发生位置和原因,使有针对性的质量控制成为可能。该管道提供可审计、可扩展的占用评估,适合集成到地理信息和应急管理工作流程中。
引用
@article{arxiv.2509.20627,
title = {Personalized Federated Dictionary Learning for Modeling Heterogeneity in Multi-site fMRI Data},
author = {Yipu Zhang and Chengshuo Zhang and Ziyu Zhou and Gang Qu and Hao Zheng and Yuping Wang and Hui Shen and Hongwen Deng},
journal= {arXiv preprint arXiv:2509.20627},
year = {2025}
}