面向无障碍街道评估的可解释多模态框架:集成视觉-语言模型感知城市诊断
机器学习
2025-06-06 v1 统计计算
摘要
虽然从图像或 GIS 派生的客观街道指标已成为城市分析的标准,但仍不足以捕捉包容性城市设计所必需的主观感知。本研究引入了新型多模态街道评估框架(MSEF),融合视觉 transformer(VisualGLM-6B)与大语言模型(GPT-4),实现对街景的可解释双输出评估。利用来自哈尔滨、中国的 15000 多张标注街景图像,我们采用 LoRA 和 P-Tuning v2 进行参数高效微调。该模型在客观特征上达到 0.84 的 F1 分数,并在与汇总居民感知一致性方面达到 89.3%,在分层社会经济地区中验证有效。除了分类准确率,MSEF 还捕捉到了情境依赖的矛盾——例如,非正式商业活动会提升感知活力,同时降低行人舒适度。它还识别了非线性和语义依赖的模式——如建筑透明度在住宅区和商业区的感知效应差异——揭示了通用空间启发式方法的局限。通过生成基于注意力机制的自然语言理由,该框架将感官数据与社会情感推断相结合,实现与 SDG 11 相容的透明诊断。本工作既提供了城市感知建模的方法学创新,也为寻求在基础设施精确性与 lived experience 之间取得平衡的规划系统提供了实际效用。
引用
@article{arxiv.2506.05088,
title = {Semi-Implicit Variational Inference via Kernelized Path Gradient Descent},
author = {Tobias Pielok and Bernd Bischl and David Rügamer},
journal= {arXiv preprint arXiv:2506.05088},
year = {2025}
}
备注
Preliminary version