中文

视觉语言模型是否将城市场景视为人类所见?城市感知基准测试

计算机视觉与模式识别 2025-10-07 v2 人工智能

摘要

了解人类如何解读城市场景有助于 informing 设计与规划。我们引入了一个小型基准测试,用于测试视觉语言模型 (VLM) 在城市感知任务中的表现,采用 100 张蒙大利省街道图像,均匀分为照片和光照逼真的合成场景。来自 7 个社区群体的 12 名参与者提供了 230 份标注表单,覆盖 30 个维度,混合了物理属性和主观印象。法语响应归一化为英文。我们在零样本设置下使用结构化提示和确定性解析器评估了 7 个视觉语言模型。对于单选题采用准确率度量,对于多标签题采用 Jaccard 重叠度量;人类间一致性采用 Krippendorff 一致性系数和成对 Jaccard 系数。结果表明,模型在可见、客观属性上的对齐程度高于主观评价。最佳系统(claude-sonnet)在多标签题上实现宏平均 0.31 和平均 Jaccard 0.48。更高的人类一致性与更好的模型得分呈正相关。合成图像略低于实拍图像得分。我们发布了基准数据集、提示模板及评估框架,以支持可复现、具不确定性感知能力的参与式城市分析。

关键词

引用

@article{arxiv.2509.14574,
  title  = {Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark},
  author = {Rashid Mushkani},
  journal= {arXiv preprint arXiv:2509.14574},
  year   = {2025}
}