中文

从俯视与街景视角理解城市土地利用:一种深度学习多模态方案

计算机视觉与模式识别 2019-05-07 v1

摘要

土地利用表征对城市规划十分重要。传统上通过实地调查或人工判读照片来完成,这两种做法耗时耗力。因此,我们旨在基于多源(或多模态)数据,用深度学习方法在城市对象级别自动绘制土地利用地图。我们考虑两种图像模态:来自 Google Maps 的俯视影像,以及来自 Google 街景(GSV)的每城市对象地面照片集合(侧视图)。这些模态带来了关于城市对象的互补视觉信息。我们提出了一种端到端可训练模型,使用 OpenStreetMap 标注作为标签。该模型可容纳地面分支中可变数量的 GSV 图片,并能在预测时缺失地面图片的情况下运行。我们在法国法兰西岛(\^Ile-de-France)地区测试了模型的有效性,并在法国南特市的一组城市对象上测试了其泛化能力。我们提出的多模态卷积神经网络比使用单一图像模态的方法取得了显著更高的精度,使其适用于自动土地利用地图更新。此外,由于基于全球许多城市均可获取的数据源,我们的方法可轻松扩展到多个城市。

关键词

引用

@article{arxiv.1905.01752,
  title  = {Understanding urban landuse from the above and ground perspectives: a deep learning, multimodal solution},
  author = {Shivangi Srivastava and John E. Vargas-Muñoz and Devis Tuia},
  journal= {arXiv preprint arXiv:1905.01752},
  year   = {2019}
}