中文

MuseCL:基于多语义对比学习预测城市社会经济指标

计算机视觉与模式识别 2026-01-30 v1 人工智能 计算机与社会 机器学习

摘要

预测城市区域内的社会经济指标对于培育城市和人类定居点的包容性、韧性和可持续性至关重要。虽然已有研究尝试利用多模态数据进行社会经济预测,但同时探索其潜在语义仍是重要挑战。为此,本文提出一种用于城市区域精细化轮廓化和社会经济预测的多语义对比学习(MuseCL)框架。在该框架中,我们通过构建街景图像和遥感图像的对比样本对,利用人类移动性和兴趣点(POI)分布的相似性,从视觉模态中提取语义特征。此外,我们从区域内嵌入的POI文本中提取语义洞见,采用预训练文本编码器。为合并获取的视觉和文本特征,我们设计了一种创新的基于跨模态的注意力融合模块,该模块利用对比机制进行集成。跨多个城市和指标的实验结果均一致地凸显了MuseCL的优势,显示其相较于各种竞争基线模型平均提高了10%的R²。本工作的代码已公开available at https://github.com/XixianYong/MuseCL。

关键词

引用

@article{arxiv.2407.09523,
  title  = {MuseCL: Predicting Urban Socioeconomic Indicators via Multi-Semantic Contrastive Learning},
  author = {Xixian Yong and Xiao Zhou},
  journal= {arXiv preprint arXiv:2407.09523},
  year   = {2026}
}