UrbanGraphEmbeddings: 面向城市科学的空间化多模态嵌入学习与评估
计算机视觉与模式识别
2026-02-10 v1 人工智能
摘要
为城市环境学习可迁移的多模态嵌入具有挑战性,因为城市理解本质上是空间性的,但现有的数据集和基准缺乏街景图像与城市结构之间的显式对齐。我们引入了UGData,一个空间化数据集,它将街景图像锚定到结构化空间图,并通过空间推理路径和空间上下文描述提供图对齐的监督,从而揭示距离、方向性、连通性和邻域上下文,超越了图像内容。基于UGData,我们提出了UGE,一种两阶段训练策略,通过结合指令引导的对比学习和基于图的空间编码,逐步且稳定地对齐图像、文本和空间结构。最后,我们引入了UGBench,一个全面的基准,用于评估空间化嵌入如何支持多样化的城市理解任务——包括地理定位排序、图像检索、城市感知和空间定位。我们在多个最先进的VLM骨干网络上开发了UGE,包括Qwen2-VL、Qwen2.5-VL、Phi-3-Vision和LLaVA1.6-Mistral,并通过LoRA调优训练固定维度的空间嵌入。基于Qwen2.5-VL-7B骨干网络构建的UGE,在训练城市上实现了图像检索提升高达44%,地理定位排序提升30%,在未见城市上分别实现了超过30%和22%的提升,证明了显式空间定位对于空间密集型城市任务的有效性。
引用
@article{arxiv.2602.08342,
title = {UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science},
author = {Jie Zhang and Xingtong Yu and Yuan Fang and Rudi Stouffs and Zdravko Trivic},
journal= {arXiv preprint arXiv:2602.08342},
year = {2026}
}