中文

UrbanFusion:用于对比学习鲁棒空间表示的随机多模态融合

机器学习 2025-10-16 v1 计算机视觉与模式识别

摘要

预测城市现象(如房价和公共卫生指标)需要有效整合各种地理空间数据。当前方法主要使用任务特定模型,而近期的基础模型通常仅支持有限的模态且缺乏多模态融合能力。为克服这些挑战,我们提出了 UrbanFusion,一种具有随机多模态融合(Stochastic Multimodal Fusion, SMF)的 Geo-Foundation Model(GeoFM)。该框架采用模态特定编码器处理不同类型的输入,包括街景图像、遥感数据、制图数据和兴趣点(POI)数据。这些多模态输入通过基于 Transformer 的融合模块集成,以学习统一表示。在全球 56 个城市的 41 项任务上进行的广泛评估表明,UrbanFusion 在一般化和预测性能上优于现有最先进的 GeoAI 模型。具体而言,它 1) 在位置编码方面超越了先前的基础模型,2) 在推断期间支持多模态输入,3) 能良好地推广到训练期间未见过的地区。UrbanFusion 在预训练和推断期间可灵活利用可用模态的任意子集,以适应不同数据可用性场景。所有源代码已发布于 https://github.com/DominikM198/UrbanFusion

关键词

引用

@article{arxiv.2510.13774,
  title  = {UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial Representations},
  author = {Dominik J. Mühlematter and Lin Che and Ye Hong and Martin Raubal and Nina Wiedemann},
  journal= {arXiv preprint arXiv:2510.13774},
  year   = {2025}
}