卫星到街道:通过生成式视觉模型从卫星图像合成灾后街景
计算机视觉与模式识别
2026-03-24 v1 人工智能
摘要
在自然灾害发生后不久,快速情报感知至关重要。传统上,卫星观测广泛用于估算损坏范围,但它们缺乏对特定结构破坏和影响的地面视角。与此同时,地面数据(如街景图像)在紧急事件期间大多不可访问。本研究探索了卫星到街道视图合成以弥合这一数据差距。我们引入两种生成策略,从卫星图像合成灾后街道视图:一种是引导式视觉语言模型(Vision-Language Model, VLM)方法,另一种是基于损伤的混合专家(Mixture-of-Experts, MoE)方法。我们使用提出的结构感知评估框架对这些方法进行基准测试。该多层次协议集成了(1)像素级质量评估、(2)基于ResNet的语义一致性验证,以及(3)一种新型的VLM作为裁判器进行感知对齐。300个灾难情景的实验结果揭示了一个关键的真实性--保真度权衡:尽管扩散方法(如ControlNet)实现了高感知真实性,但常常幻觉结构细节。定量结果显示,标准ControlNet实现最高的语义准确性,为0.71,而VLM增强和MoE模型在文本ural可信度方面优异,但在语义清晰度方面受限。本工作为可信的跨视图合成奠定了基准,强调视觉上逼真的生成可能仍未保留可靠灾害评估所需的关键结构信息。
引用
@article{arxiv.2603.20697,
title = {Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models},
author = {Yifan Yang and Lei Zou and Wendy Jepson},
journal= {arXiv preprint arXiv:2603.20697},
year = {2026}
}
备注
Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)