中文

UrbanSense:基于视觉大语言模型的城市街景定量分析框架

计算机视觉与模式识别 2025-08-05 v2 人工智能

摘要

城市文化和建筑风格因地理、时间、历史和社会政治因素的差异,在不同城市之间有显著差异。理解这些差异对于预测城市未来的演变至关重要。作为中国历史连续性和现代创新代表,北京和深圳为探索城市街景的转变提供了有价值的视角。然而,传统的城市文化研究方法往往依赖专家解读和历史文献,这些方法在不同情境下难以标准化。为此,我们提出一种基于视觉语言模型的多模态研究框架,实现对城市街景风格差异的自动化和可扩展分析。该方法增强了城市形态研究的客观性和数据驱动性。本研究的贡献如下:首先,我们构建了UrbanDiffBench数据集,包含来自不同时期和地区的建筑图像。其次,我们开发了UrbanSense——首个基于视觉语言模型的城市街景分析框架,实现城市风格表征的定量生成与比较。第三,实验结果显示,超过80%的生成描述通过t检验(p<0.05)。主观评估中,城市(0.912)和时期(0.833)的高Phi分数确认了该方法捕捉细微风格差异的能力。这一结果凸显了该方法量化和解释城市风格演变的潜力,为未来设计提供了科学依据。

关键词

引用

@article{arxiv.2506.10342,
  title  = {UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models},
  author = {Jun Yin and Jing Zhong and Peilin Li and Ruolin Pan and Pengyu Zeng and Miao Zhang and Shuai Lu},
  journal= {arXiv preprint arXiv:2506.10342},
  year   = {2025}
}