BuildingView:利用街景影像和多模态大语言模型构建城市建筑外观数据库
人工智能
2025-03-10 v2 计算机视觉与模式识别
计算机与社会
摘要
城市建筑外观正在成为城市分析的重要议题,得益于街景影像的进步及其与城市研究的融合。多模态大语言模型(LLM)为城市标注提供了强大的工具,使我们能够深入洞察城市环境。然而,在创建准确且详尽的城市建筑外观数据库方面仍面临挑战,包括识别能源效率、环境可持续性和以人为本设计的关键指标,以及系统化组织这些指标的问题。为此,我们提出BuildingView,一种新颖的方法,将来自Google街景影像的高分辨率视觉数据与来自OpenStreetMap的空间信息通过Overpass API集成。该研究提高了城市建筑外观数据的准确性,识别了关键的可持续性和设计指标,并开发了其提取和分类的框架。我们的 methodology 包括系统性文献综述、建筑和街景抽样,以及使用ChatGPT-4O API进行标注。所得数据库经New York City、Amsterdam和Singapore的数据验证,提供了一个为城市研究提供全面工具,支持城市规划、建筑设计和环境政策的明智决策。BuildingView的代码已发布于https://github.com/Jasper0122/BuildingView。
引用
@article{arxiv.2409.19527,
title = {BuildingView: Constructing Urban Building Exteriors Databases with Street View Imagery and Multimodal Large Language Mode},
author = {Zongrong Li and Yunlei Su and Hongrong Wang and Wufan Zhao},
journal= {arXiv preprint arXiv:2409.19527},
year = {2025}
}
备注
15 pages, 6 figures