中文

面向开放词表遥感图像语义分割的探索

计算机视觉与模式识别 2024-12-30 v1 多媒体

摘要

最近,基于深度学习的方法在遥感图像分割方面取得了突破性进展。然而,这些方法通常依赖于预定义的语义类别集合,当迁移到新类别时需要额外的图像标注和模型训练。更重要的是,无法对任意语义类别进行分割。本文引入 Open-Vocabulary Remote Sensing Image Semantic Segmentation(OVRSISS),旨在对遥感图像中的任意语义类别进行分割。为解决 OVRSISS 数据集的匮乏问题,我们开发了覆盖40个多样化语义类别的综合数据集 LandDiscover50K(包含51,846张图像)。此外,我们提出了一种新型框架 GSNet,集成来自特殊遥感模型的领域先验和通用视觉语言模型的多样化能力。技术上,GSNet 包含 Dual-Stream Image Encoder(DSIE)、Query-Guided Feature Fusion(QGFF)和 Residual Information Preservation Decoder(RIPD)。DSIE 首先从两种特殊模型和通用模型中捕获全面特征。随后,依据可变词表的指导,QGFF 整合专家和泛专家特征,使其相互补充。最后,提出 RIPD 用于聚合多源特征,以获得更精确的掩码预测。实验表明,我们的方法在其他方法上取得显著优势,我们提出的 LandDiscover50K 改善了 OVRSISS 方法的性能。该数据集和方法将公开于 https://github.com/yecy749/GSNet。

关键词

引用

@article{arxiv.2412.19492,
  title  = {Towards Open-Vocabulary Remote Sensing Image Semantic Segmentation},
  author = {Chengyang Ye and Yunzhi Zhuge and Pingping Zhang},
  journal= {arXiv preprint arXiv:2412.19492},
  year   = {2024}
}

备注

Accepted by AAAI2025