中文

UrbanVLP:用于城市社会经济指标预测的多粒度视觉语言预训练

计算机视觉与模式识别 2025-01-23 v3 人工智能

摘要

城市社会经济指标预测旨在利用数据驱动方法推断不同城市景观中与可持续发展相关的各种指标。然而,现有的预训练模型,特别是那些依赖卫星图像的模型,面临双重挑战。首先,仅关注卫星数据中的宏观模式可能会引入偏差,缺乏微观层面的细微细节,例如某地的建筑细节。其次,前人工作 UrbanCLIP 充分利用 LLM 的广泛知识所生成的文本,经常出现幻觉和同质化等问题,导致缺乏可靠的质量。针对这些问题,我们设计了一种基于视觉语言预训练的新型框架,名为 UrbanVLP。我们的 UrbanVLP 无缝整合了来自宏观(卫星)和微观(街景)层面的多粒度信息,克服了先前预训练模型的局限性。此外,它引入了自动文本生成和校准,为生成高质量的城市图像文本描述提供了稳健保障。在六项社会经济指标预测任务上进行的严格实验突显了其优越的性能。

关键词

引用

@article{arxiv.2403.16831,
  title  = {UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction},
  author = {Xixuan Hao and Wei Chen and Yibo Yan and Siru Zhong and Kun Wang and Qingsong Wen and Yuxuan Liang},
  journal= {arXiv preprint arXiv:2403.16831},
  year   = {2025}
}

备注

Accepted as a full paper by AAAI'25 - AI for Social Impact Track