MultiScene:用于单张航拍图像多场景识别的大规模数据集与基准
计算机视觉与模式识别
2022-02-16 v3
摘要
航拍场景识别是解读高分辨率航拍影像的基础研究问题。过去几年多数研究聚焦于将图像分类为单一场景类别,而真实场景中单张图像常包含多个场景。因此,本文研究一个更实用但少有探索的任务——单图像多场景识别。为此,我们构建了包含 100,000 张无约束高分辨率航拍图像的大规模数据集 MultiScene。考虑到人工标注此类图像极为费力,我们借助众包平台(如 OpenStreetMap (OSM))的低成本标注。但 OSM 数据可能存在不完整与错误,给图像标签引入噪声。为解决该问题,我们人工核查 14,000 张图像并修正其场景标签,得到干净标注子集 MultiScene-Clean。基于此,我们可用干净数据开发与评估深度网络进行多场景识别。此外,我们提供全部图像的众包标注以研究带噪标签下的网络学习。我们在 MultiScene-Clean 与 MultiScene 上以大量基线模型开展实验,分别提供单图像多场景识别基准与该任务下带噪标签学习基准。为推进研究,数据集与训练模型发布于 https://gitlab.lrz.de/ai4eo/reasoning/multiscene。
引用
@article{arxiv.2104.02846,
title = {MultiScene: A Large-scale Dataset and Benchmark for Multi-scene Recognition in Single Aerial Images},
author = {Yuansheng Hua and Lichao Mou and Pu Jin and Xiao Xiang Zhu},
journal= {arXiv preprint arXiv:2104.02846},
year = {2022}
}