中文

UrbanCLIP:利用来自网络的对比语言-图像预训练学习文本增强的城市区域画像

计算与语言 2024-03-26 v2 人工智能

摘要

从网络来源数据中进行城市区域画像对城市规划与可持续发展至关重要。我们正见证大语言模型(LLM)在各领域的兴起,尤其在处理视觉-语言学习等多模态数据研究中,文本模态作为图像的补充信息。由于文本模态从未被引入城市区域画像的模态组合中,本文旨在回答两个基本问题:i)文本模态能否增强城市区域画像?ii)若能,以何种方式、在哪些方面?为回答这些问题,我们利用大语言模型(LLM)的能力,引入了首个将文本模态知识整合进城市影像画像的 LLM 增强框架,称为基于对比语言-图像预训练的 LLM 增强城市区域画像(UrbanCLIP)。具体而言,它首先通过开源的图生文 LLM 为每张卫星图像生成详尽文本描述。随后,模型在图像-文本对上训练,将自然语言监督无缝统一于城市视觉表征学习,并结合对比损失与语言建模损失。在四个中国主要都市预测三项城市指标的结果展示了其优越性能,相较最先进方法在 R^2 上平均提升 6.1%。我们的代码与图像-语言数据集将在论文录用后发布。

关键词

引用

@article{arxiv.2310.18340,
  title  = {UrbanCLIP: Learning Text-enhanced Urban Region Profiling with Contrastive Language-Image Pretraining from the Web},
  author = {Yibo Yan and Haomin Wen and Siru Zhong and Wei Chen and Haodong Chen and Qingsong Wen and Roger Zimmermann and Yuxuan Liang},
  journal= {arXiv preprint arXiv:2310.18340},
  year   = {2024}
}

备注

Accepted by The Web Conference 2024