从多模态多图学习邻域表示:图像、文本、移动图及更多
机器学习
2021-05-07 v1 计算机视觉与模式识别
摘要
近期的城市化伴随着地理标记数据的丰富,例如街景和兴趣点(POI)。由更丰富数据模态增强的区域嵌入使研究人员和城市管理者能更好地理解建成环境、社会经济和城市动态。尽管已有一些同时利用多模态输入的尝试,现有方法可通过在同一嵌入空间中引入不同的“邻近性”度量来改进——不仅利用刻画区域特征的数据(如街景、本地商业模式),也利用描绘区域间关系的数据(如出行、道路网络)。为此,我们提出一种新方法,根据其与邻域区域(如瓦片、人口普查块、邮政编码区域等)的关系,将多模态地理标记输入作为多图的节点或边特征进行整合。随后我们基于多图上的对比采样方案学习邻域表示。具体而言,我们使用街景图像和 POI 特征刻画邻域(节点),并使用人类移动性刻画邻域间关系(有向边)。我们通过定量的下游任务以及嵌入空间的定性分析展示了所提方法的有效性:我们训练的嵌入优于仅使用单模态数据作为区域输入的方法。
引用
@article{arxiv.2105.02489,
title = {Learning Neighborhood Representation from Multi-Modal Multi-Graph: Image, Text, Mobility Graph and Beyond},
author = {Tianyuan Huang and Zhecheng Wang and Hao Sheng and Andrew Y. Ng and Ram Rajagopal},
journal= {arXiv preprint arXiv:2105.02489},
year = {2021}
}