中文

TorontoCity:用百万之眼观测世界

计算机视觉与模式识别 2016-12-02 v1

摘要

本文我们介绍了 TorontoCity 基准数据集,其覆盖整个大多伦多地区 (GTA),包含 712.5 km2km^2 土地、8439 kmkm 道路以及约 400,000 栋建筑。我们的基准提供了从飞机、无人机和环绕城市行驶的汽车所捕获的世界的多种视角。人工标注如此大规模的数据集是不可行的。相反,我们提议利用不同来源的高精度地图来创建真值。为实现这一目标,我们开发了能够将全部数据源与地图对齐且只需最少人工监督的算法。我们设计了多种任务,包括建筑高度估计(重建)、道路中心线与路缘提取、建筑实例分割、建筑轮廓提取(重组)、语义标注和场景类型分类(识别)。我们的初步研究表明,这些任务中的大多数对现代卷积神经网络而言仍然困难。

关键词

引用

@article{arxiv.1612.00423,
  title  = {TorontoCity: Seeing the World with a Million Eyes},
  author = {Shenlong Wang and Min Bai and Gellert Mattyus and Hang Chu and Wenjie Luo and Bin Yang and Justin Liang and Joel Cheverie and Sanja Fidler and Raquel Urtasun},
  journal= {arXiv preprint arXiv:1612.00423},
  year   = {2016}
}