中文

一种基于 Transformer 的细分辨率遥感图像语义分割新方案

计算机视觉与模式识别 2022-06-06 v6

摘要

采用编码器-解码器架构的全卷积网络(FCN)一直是语义分割的标准范式。编码器-解码器架构利用编码器捕获多级特征图,并由解码器将其整合进最终预测。由于上下文对精确分割至关重要,人们已付出巨大努力以智能方式提取此类信息,包括采用空洞/膨胀卷积或插入注意力模块。然而,这些尝试均基于以 ResNet 或其他骨干网络为基的 FCN 架构,无法从理论概念上充分利用上下文。相比之下,我们引入 Swin Transformer 作为骨干来提取上下文信息,并设计了一种新颖的密集连接特征聚合模块(DCFAM)解码器以恢复分辨率并生成分割图。在两个遥感语义分割数据集上的实验结果证明了所提方案的有效性。代码见 https://github.com/WangLibo1995/GeoSeg

关键词

引用

@article{arxiv.2104.12137,
  title  = {A Novel Transformer Based Semantic Segmentation Scheme for Fine-Resolution Remote Sensing Images},
  author = {Libo Wang and Rui Li and Chenxi Duan and Ce Zhang and Xiaoliang Meng and Shenghui Fang},
  journal= {arXiv preprint arXiv:2104.12137},
  year   = {2022}
}

备注

Accepted by GRSL.https://ieeexplore.ieee.org/abstract/document/9681903