使用扩散模型从街景图像设计街景
计算机视觉与模式识别
2026-05-19 v1
摘要
街景图像(SVI)广泛用于量化城市环境关键指标,如绿地、天空或道路视角指数。然而,现有研究主要聚焦于衡量当前街景,很少支持生成替代或不存在的城市情景,而这是地理学领域的核心任务,如城市规划和设计。为此,我们提出一种生成式多模态 AI 框架,可在目标视觉指标条件下合成替代街景,实现城市情景的直接视觉探索。我们首先构建了一个多模态数据集,将 SVI 与文本描述、分割图、道路掩码以及城市景观中视觉元素的量化指标(以芝加哥和奥里анд为例)对齐。使用该数据集,我们展示了扩散模型可在响应文本和图像控制下生成逼真且语义一致的街景图像。我们的定量评估表明,纳入视觉控制可提高语义一致性,将 LPIPS 指数约降低 6%,同时保持全局视觉真实性。此外,整体语义一致性在奥里анд提升 23.7%,在芝加哥提升 46.4%,如以 mIoU 指数衡量,类别级提升甚至超过 100%。街景生成可通过文本和视觉提示进行细粒度控制,当文本和视觉控制发生冲突时,视觉控制始终占主导,表明明确的控制层次以及进一步发展视觉控制以满足城市场景生成的重要性。总体而言,本工作为使用 SVI 和扩散模型进行街景生成建立了重要基准,说明生成式 AI 如何作为一种实用、可扩展且可控的方法,用于城市情景探索。
引用
@article{arxiv.2605.17527,
title = {Designing streetscapes from street-view imagery using diffusion models},
author = {Yuzhou Chen and Yuebing Liang and Lingqian Hu and Kailai Sun and Qingqi Song and Chang Zhao and Shenhao Wang},
journal= {arXiv preprint arXiv:2605.17527},
year = {2026}
}