中文

基于对比学习的模态定制图建模框架用于城市区域表征

计算机视觉与模式识别 2025-09-30 v1 应用统计

摘要

基于图的方法已成为建模多模态城市数据和学习区域表征以用于多种下游任务的强大范式。然而,现有方法存在两个主要局限。(1) 它们通常对所有模态采用相同的图神经网络架构,无法捕捉模态特异性的结构和特征。(2) 在融合阶段,它们常假设不同模态的聚合权重在各区域间保持不变,从而忽视空间异质性,导致表征次优。为解决这些问题,我们提出 MTGRR,一个面向城市区域表征的模态定制图建模框架,构建于包含兴趣点(POI)、出租车出行、土地利用、道路要素、遥感影像和街景图像的多模态数据集之上。(1) MTGRR 根据空间密度和数据特征将模态分为两类:聚合级模态和点级模态。对于聚合级模态,MTGRR 采用专家混合(MoE)图架构,每个模态由专用的专家 GNN 处理以捕捉不同的模态特异性特征。对于点级模态,构建双层 GNN 以提取细粒度的视觉语义特征。(2) 为获得有效的区域表征以应对空间异质性,设计了一种空间感知的多模态融合机制,以动态推断区域特定的模态融合权重。基于此图建模框架,MTGRR 进一步采用联合对比学习策略,整合区域聚合级、点级和融合级目标以优化区域表征。在两个真实数据集上涵盖六个模态和三个任务的实验表明,MTGRR 一致优于现有最先进基线,验证了其有效性。

关键词

引用

@article{arxiv.2509.23772,
  title  = {A Modality-Tailored Graph Modeling Framework for Urban Region Representation via Contrastive Learning},
  author = {Yaya Zhao and Kaiqi Zhao and Zixuan Tang and Zhiyuan Liu and Xiaoling Lu and Yalei Du},
  journal= {arXiv preprint arXiv:2509.23772},
  year   = {2025}
}