CityLens:面向城市社会经济感知的大型视觉语言模型评估
人工智能
2026-03-03 v2 计算与语言
摘要
通过视觉数据理解城市社会经济条件是可持续发展与政策规划中一项充满挑战但至关重要的任务。在这项工作中,我们引入了 \textit{CityLens},这是一个综合基准,旨在评估大型视觉语言模型 (LVLM) 从卫星和街景图像预测社会经济指标的能力。我们构建了一个涵盖全球 17 个城市的多模态数据集,跨越 6 个关键领域:经济、教育、犯罪、交通、健康和环境,反映了城市生活的多面性。基于该数据集,我们定义了 11 项预测任务,并采用了 3 种评估范式:直接指标预测、归一化指标估计和基于特征的回归。我们在这些任务上对 17 个最先进的 LVLM 进行了基准测试。这些使得 CityLens 成为迄今为止在地理覆盖范围、指标多样性和模型规模方面最广泛的社会经济基准。我们的结果表明,尽管 LVLM 展现出有前景的感知和推理能力,但它们在预测城市社会经济指标方面仍存在局限性。CityLens 提供了一个统一框架来诊断这些局限性,并指导未来利用 LVLM 理解和预测城市社会经济模式的努力。代码和数据可在 https://github.com/tsinghua-fib-lab/CityLens 获取。
引用
@article{arxiv.2506.00530,
title = {CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing},
author = {Tianhui Liu and Hetian Pang and Xin Zhang and Tianjian Ouyang and Zhiyuan Zhang and Jie Feng and Yong Li and Pan Hui},
journal= {arXiv preprint arXiv:2506.00530},
year = {2026}
}
备注
Accepted by ICLR 2026