OpenFACADES:基于街景图像的人类建筑标题与属性数据丰富的开放框架
计算机视觉与模式识别
2025-11-04 v2
摘要
建筑属性(如高度、用途和材料)在空间数据基础设施中发挥着关键作用,支持各种城市应用。尽管如此,这些建筑属性数据在许多城市地区仍稀缺。近期进展使我们能够利用遥感和街道级图像从事客观的建筑属性提取。然而,建立一个集成多种开放数据集、获取整体建筑图像并在规模化层面推断综合建筑属性的管道仍是一个重大挑战。本研究是首批之一,通过引入OpenFACADES这一开放框架,利用多模态众包数据丰富建筑轮廓,同时包含客观属性和语义描述,通过多模态大语言模型实现。首先,我们通过等距视野分析将来自Mapillary的街景图像元数据与OpenStreetMap几何图形集成,识别提供观察目标建筑的合适视角的图像。其次,我们自动化检测全景图像中的建筑立面,并定制一种重投影方法,将对象转换为近似真实观察的整体透视视图。第三,我们引入一种创新方法,运用和研究开源大型视觉语言模型(VLM)在建筑水平分析中进行多属性预测和开放词汇标题生成的能力,利用来自七个城市的31,180张标注图像的全球数据集。评估结果表明,微调的VLM在多属性推断方面表现优异,超越单属性计算机视觉模型和零-shot ChatGPT-4o。进一步实验确认其在文化差异地区和不同图像条件下的优异推广性和鲁棒性。
引用
@article{arxiv.2504.02866,
title = {OpenFACADES: An Open Framework for Architectural Caption and Attribute Data Enrichment via Street View Imagery},
author = {Xiucheng Liang and Jinheng Xie and Tianhong Zhao and Rudi Stouffs and Filip Biljecki},
journal= {arXiv preprint arXiv:2504.02866},
year = {2025}
}