面向大规模城市区域重建的多标签像素级分类
计算机视觉与模式识别
2018-01-25 v2
摘要
目标分类是计算机视觉领域的众多圣杯之一,因此已有大量算法被提出。特别是近年来,主要由于深度学习技术效率和可及性的提升,该领域取得了显著进展。事实上,对于单标签目标分类(即图像中仅存在一个目标),最先进的技术采用深度神经网络,并报告了非常接近人类水平的表现。但在某些专门应用中,单标签目标级分类是不够的;例如,当图像包含多个不同标签的交织目标时。本文中,我们解决多标签像素级分类这一复杂问题。我们提出了基于卷积神经网络(CNN)执行多标签像素级分类的独特解决方案,并将其应用于大规模城市重建。采用监督学习方法,使用 LiDAR 和卫星图像训练一个 13 层的 CNN。我们进行了一项实证研究,以确定使 CNN 达到最优性能的超参数。通过在输入和标注数据的五个不同尺度上训练网络来引入尺度不变性。这为每个不同尺度生成了六个像素级分类结果。然后训练一个 SVM,将六个像素级分类映射为单一标签。最后,我们使用图割方法,结合马尔可夫随机场(MRF)先验进行最大后验(MAP)估计,以细化边界像素标签。所得的像素级分类随后被用于精确提取和重建大规模城市区域中的建筑物。所提出的方法已经过广泛测试,本文报告了其结果。
引用
@article{arxiv.1709.07368,
title = {Multi-label Pixelwise Classification for Reconstruction of Large-scale Urban Areas},
author = {Yuanlie He and Sudhir Mudur and Charalambos Poullis},
journal= {arXiv preprint arXiv:1709.07368},
year = {2018}
}