中文

Transformer 结合卷积:一种用于甚高分辨率城市场景图像语义分割的双边感知网络

计算机视觉与模式识别 2022-06-06 v2

摘要

从甚高分辨率(VFR)城市场景图像中进行语义分割在自动驾驶、土地覆盖分类和城市规划等多个应用场景中发挥着重要作用。然而,VFR 图像中包含的大量细节,尤其是物体尺度和外观上的显著变化,严重限制了现有深度学习方法的潜力。解决此类问题是遥感领域一个有前景的研究方向,为场景级景观格局分析与决策铺平了道路。本文提出一种双边感知网络(Bilateral Awareness Network, BANet),其包含依赖路径与纹理路径,以充分捕获 VFR 图像中的长程关系与细粒度细节。具体而言,依赖路径基于 ResT(一种具有内存高效多头自注意力的新型 Transformer 骨干)构建,而纹理路径建立在堆叠卷积操作之上。此外,利用线性注意力机制,设计了一个特征聚合模块以有效融合依赖特征与纹理特征。在三个大规模城市场景图像分割数据集(即 ISPRS Vaihingen 数据集、ISPRS Potsdam 数据集和 UAVid 数据集)上开展的广泛实验证明了我们的 BANet 的有效性。具体而言,在 UAVid 数据集上取得了 64.6% 的 mIoU。代码见 https://github.com/WangLibo1995/GeoSeg。

关键词

引用

@article{arxiv.2106.12413,
  title  = {Transformer Meets Convolution: A Bilateral Awareness Network for Semantic Segmentation of Very Fine Resolution Urban Scene Images},
  author = {Libo Wang and Rui Li and Dongzhi Wang and Chenxi Duan and Teng Wang and Xiaoliang Meng},
  journal= {arXiv preprint arXiv:2106.12413},
  year   = {2022}
}

备注

Accepted by Remote Sensing, see https://www.mdpi.com/2072-4292/13/16/3065