一种用于航拍场景解译与地理定位的多阶段多任务神经网络
计算机视觉与模式识别
2018-04-05 v1
摘要
航拍图像中的语义分割与基于视觉的地理定位是计算机视觉中具有挑战性的任务。由于深度卷积网络的出现以及相对低成本的无人机(UAV)的可用性,它们目前在领域中正引起越来越多的关注。我们提出了一种新颖的多任务多阶段神经网络,能够在单次前向传播中同时处理这两个问题。我们网络的第一阶段预测逐像素类别标签,而第二阶段通过两个分支提供精确位置。一个分支使用回归网络,另一个用于预测以分割任务方式训练的位置图。从结构角度看,我们的架构在每个阶段使用编码器-解码器模块,并复用相同的编码器结构。此外,其规模受限以可在嵌入式 GPU 上处理。我们在感兴趣的城市范围区域内,从空间分辨率为每像素 1 平方米的卫星图像中实现了商业 GPS 级别的定位精度。在语义分割任务上,我们在两个具有挑战性的数据集 Inria Aerial Image Labeling 和 Massachusetts Buildings 上取得了最先进(state-of-the-art)的结果。
引用
@article{arxiv.1804.01322,
title = {A Multi-Stage Multi-Task Neural Network for Aerial Scene Interpretation and Geolocalization},
author = {Alina Marcu and Dragos Costea and Emil Slusanschi and Marius Leordeanu},
journal= {arXiv preprint arXiv:1804.01322},
year = {2018}
}
备注
23 pages, 11 figures. Under review at the 15th European Conference on Computer Vision (ECCV 2018)