中文

MLRSNet:用于语义场景理解的多标签高空间分辨率遥感数据集

计算机视觉与模式识别 2020-10-02 v1

摘要

为更好地理解遥感领域的场景图像,对场景图像进行多标签标注是必要的。此外,为提升深度学习模型处理语义场景理解任务的性能,在大规模标注数据上训练它们至关重要。然而,大多数现有数据集以单标签标注,无法良好描述复杂的遥感图像,因为场景图像可能具有多个土地覆盖类别。少数多标签高空间分辨率遥感数据集被开发用于训练基于多标签的任务(如场景分类与图像检索)的深度学习模型。为解决此问题,本文构建了一个名为 MLRSNet 的多标签高空间分辨率遥感数据集,用于从俯视视角进行深度学习的语义场景理解。其由高分辨率光学卫星或航空图像组成。MLRSNet 共包含 46 个场景类别下的 109,161 个样本,每幅图像至少具有 60 个预定义标签中的其一。我们设计了视觉识别任务,包括基于多标签的图像分类与图像检索,其中利用 MLRSNet 评估了多种深度学习方法。实验结果表明,MLRSNet 是未来研究的重要基准,并补充了当前广泛使用的如 ImageNet 的数据集,填补了多标签图像研究的空白。此外,我们将持续扩展 MLRSNet。MLRSNet 及所有相关材料已公开于 https://data.mendeley.com/datasets/7j9bv9vwsx/2 与 https://github.com/cugbrs/MLRSNet.git。

关键词

引用

@article{arxiv.2010.00243,
  title  = {MLRSNet: A Multi-label High Spatial Resolution Remote Sensing Dataset for Semantic Scene Understanding},
  author = {Xiaoman Qi and PanPan Zhu and Yuebin Wang and Liqiang Zhang and Junhuan Peng and Mengfan Wu and Jialong Chen and Xudong Zhao and Ning Zang and P. Takis Mathiopoulos},
  journal= {arXiv preprint arXiv:2010.00243},
  year   = {2020}
}