中文

MEET:用于免缩放遥感图像细粒度地理空间场景分类的百万级数据集

计算机视觉与模式识别 2025-03-17 v1 人工智能

摘要

使用遥感图像进行准确的细粒度地理空间场景分类对于广泛的应用至关重要。然而,现有的方法通常依赖于手动在不同尺度上缩放遥感图像以创建典型的场景样本。这种方法无法充分支持现实场景中固定分辨率的图像解释需求。为了解决这一限制,我们引入了百万级细粒度地理空间场景分类数据集(MEET),其中包含超过 103 万个免缩放遥感场景样本,手动标注为 80 个细粒度类别。在 MEET 中,每个场景样本遵循场景嵌套布局,其中中心场景作为参考,辅助场景为细粒度分类提供关键的空间上下文。此外,为了应对场景嵌套分类这一新兴挑战,我们提出了上下文感知 Transformer(CAT),这是一种专门为该任务设计的模型,通过自适应地融合空间上下文来准确分类场景样本。CAT 通过学习捕获中心场景和辅助场景之间关系的注意力特征,自适应地融合空间上下文以准确分类场景样本。基于 MEET,我们建立了一个用于细粒度地理空间场景分类的综合基准,将 CAT 与 11 个竞争基线进行了评估。结果表明,CAT 显著优于这些基线,在使用 Swin-Large 主干时实现了 1.88% 更高的平衡准确率(BA),在使用 Swin-Huge 主干时实现了显著的 7.87% 的提升。进一步的实验验证了 CAT 中每个模块的有效性,并展示了 CAT 在城市功能区制图中的实际适用性。源代码和数据集将在 https://jerrywyn.github.io/project/MEET.html 上公开提供。

关键词

引用

@article{arxiv.2503.11219,
  title  = {MEET: A Million-Scale Dataset for Fine-Grained Geospatial Scene Classification with Zoom-Free Remote Sensing Imagery},
  author = {Yansheng Li and Yuning Wu and Gong Cheng and Chao Tao and Bo Dang and Yu Wang and Jiahao Zhang and Chuge Zhang and Yiting Liu and Xu Tang and Jiayi Ma and Yongjun Zhang},
  journal= {arXiv preprint arXiv:2503.11219},
  year   = {2025}
}