UrbanLLaVA:面向城市智能的多模态大语言模型,具备空间推理与理解能力
计算机视觉与模式识别
2025-07-01 v1 人工智能
计算与语言
摘要
城市研究涉及广泛的场景与任务,需要对多模态数据进行理解。现有方法通常聚焦于特定的数据类型,在城市领域缺乏对其进行综合处理的统一框架。多模态大语言模型(MLLMs)近期的成功为克服这一局限性提供了有希望的机遇。在本文中,我们提出了 ,这是一种多模态大语言模型,旨在同时处理这四类数据,并在多样的城市任务中相较于通用 MLLMs 取得优异性能。在 中,我们首先构建了一个多样化的城市指令数据集,涵盖单模态与跨模态城市数据,范围从局部视角到城市环境的全局视角。此外,我们提出了一个多阶段训练框架,将空间推理增强与领域知识学习解耦,从而提升 在多样城市任务中的兼容性与下游性能。最后,我们还扩展了现有的城市研究基准,以评估 MLLMs 在广泛城市任务中的表现。来自三个城市的实验结果表明, 在单模态任务与复杂的跨模态任务中均优于开源与专有 MLLMs,并展现出跨城市的稳健泛化能力。源代码与数据已通过 https://github.com/tsinghua-fib-lab/UrbanLLaVA 向研究界公开。
引用
@article{arxiv.2506.23219,
title = {UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding},
author = {Jie Feng and Shengyuan Wang and Tianhui Liu and Yanxin Xi and Yong Li},
journal= {arXiv preprint arXiv:2506.23219},
year = {2025}
}
备注
Accepted by ICCV 2025