航空场景解析:从瓦片级场景分类到像素级语义标注
计算机视觉与模式识别
2022-01-11 v2
摘要
给定一张航空图像,航空场景解析(ASP)旨在解释图像内容的语义结构,例如通过为图像的每个像素分配一个语义标签。随着数据驱动方法的普及,过去几十年中,在使用高分辨率航空图像时,通过瓦片级场景分类或基于分割的图像分析方案处理该问题,ASP 取得了可喜进展。然而,前一种方案常产生带有瓦片边界的结果,而后一种方案需要处理从像素到语义的复杂建模过程,这通常要求具有像素级语义标签的大规模且良好标注的图像样本。本文从瓦片级场景分类到像素级语义标注的角度解决 ASP 中的这些问题。具体而言,我们首先通过文献综述重新审视航空图像解译。然后,我们提出一个包含一百万张航空图像的大规模场景分类数据集 Million-AID。利用该数据集,我们还使用经典卷积神经网络(CNNs)报告了基准实验。最后,我们通过统一瓦片级场景分类与基于对象的图像分析来实现像素级语义标注,从而完成 ASP。大量实验表明,Million-AID 是一个具有挑战性但有用的数据集,可作为评估新开发算法的基准。当从 Million-AID 迁移知识时,在 Million-AID 上预训练的 CNN 模型微调后始终优于在 ImageNet 上预训练的模型用于航空场景分类。此外,我们设计的层次化多任务学习方法在具有挑战性的 GID 上实现了最先进的像素级分类,将航空图像解译中的瓦片级场景分类推向像素级语义标注。
引用
@article{arxiv.2201.01953,
title = {Aerial Scene Parsing: From Tile-level Scene Classification to Pixel-wise Semantic Labeling},
author = {Yang Long and Gui-Song Xia and Liangpei Zhang and Gong Cheng and Deren Li},
journal= {arXiv preprint arXiv:2201.01953},
year = {2022}
}