中文

大语言模型能否评估城市设计质量?基于专业水平的步行性指标评估

计算机视觉与模式识别 2025-05-01 v1

摘要

城市街道环境对支持公共空间人类活动至关重要。大数据(如街景图像(SVI)结合多模态大语言模型(MLLM))正变革研究者和实践者如何探索、测量和评估城市环境的语义和视觉元素。鉴于使用MLLM创建自动化评估工作流程的门槛较低,有必要探索这些概率模型所带来的风险与机遇。特别是,专家知识的整合程度对MLLM在评估基于SVI的城市设计质量方面的能力尚未得到充分探索。本研究旨在探索如何通过将更正式和结构化的专家城市设计知识整合到MLLM(ChatGPT-4)的输入提示中,从而增强该模型在使用SVI评估建筑环境步行性方面的能力和可靠性。我们收集现有文献中的步行性指标并使用相关本体法进行分类。随后,我们选取其中一部分指标,聚焦行人安全和吸引力的子主题,开发相应的提示。我们分析了MLLM在通过包含不同清晰度和具体性评估标准的提示下评估SVI步行性子主题的能力。我们的实验表明,MLLM能够基于常识提供评估和解释,支持多模态图像-文本评估的自动化。然而,它们通常提供更乐观的评分,并在解释提供的指标时出错,导致错误的评估。通过整合专家知识,MLLM的评估性能表现出更高的一致性和集中性。

关键词

引用

@article{arxiv.2504.21040,
  title  = {Can a Large Language Model Assess Urban Design Quality? Evaluating Walkability Metrics Across Expertise Levels},
  author = {Chenyi Cai and Kosuke Kuriyama and Youlong Gu and Filip Biljecki and Pieter Herthogs},
  journal= {arXiv preprint arXiv:2504.21040},
  year   = {2025}
}