Urban-ImageNet:面向城市空间感知的大规模多模态数据集与评估框架
计算机视觉与模式识别
2026-05-12 v1 信息检索
机器学习
摘要
我们提出了 Urban-ImageNet,一个用于从用户生成的社交媒体图像中进行城市空间感知的大规模多模态数据集和评估基准。该语料库包含 2019 至 2025 年间从中国 24 个城市 61 个城市地点的微博上收集的超过 200 万张公开社交媒体图像及配对的文本帖子,并设有 1K、10K 和 100K 规模的受控基准子集,以及用于大规模训练和评估的完整 2M 语料库。Urban-ImageNet 由 HUSIC(分层城市空间图像分类框架)组织,该框架定义了一个基于城市理论的 10 类分类法。该分类法旨在区分已激活和未激活的公共空间、城市外部和内部环境、住宿空间、消费内容、肖像以及非空间社交媒体内容。Urban-ImageNet 不将城市图像视为通用场景数据,而是评估机器感知模型能否捕捉对城市研究至关重要的空间、社会和功能差异。该基准在一个标准化库中支持三项任务:(T1)城市场景语义分类,(T2)跨模态图文检索,以及(T3)实例分割。我们的实验评估了代表性的视觉、视觉-语言和分割模型,揭示了在监督场景分类上的强劲表现,但在跨模态检索和实例级城市对象分割中表现出更具挑战性的行为。一项多尺度研究进一步检验了当平衡训练数据从 1K、10K 增加到 100K 张图像时模型性能的变化。Urban-ImageNet 提供了一个统一的、有理论依据的、多城市的基准,用于评估 AI 系统如何跨模态、尺度和任务设定感知和解释当代城市空间。数据集和基准可在以下地址获取:huggingface.co/datasets/Yiwei-Ou/Urban-ImageNet 和 github.com/yiasun/dataset-2。
引用
@article{arxiv.2605.09936,
title = {Urban-ImageNet: A Large-Scale Multi-Modal Dataset and Evaluation Framework for Urban Space Perception},
author = {Yiwei Ou and Chung Ching Cheung and Jun Yang Ang and Xiaobin Ren and Ronggui Sun and Guansong Gao and Kaiqi Zhao and Manfredo Manfredini},
journal= {arXiv preprint arXiv:2605.09936},
year = {2026}
}