Swin Transformer 耦合 CNN 构成强上下文编码器用于 VHR 影像道路提取
计算机视觉与模式识别
2023-05-30 v2
摘要
由于显著的类内差异、不明显的类间区别以及由阴影、树木和建筑物造成的遮挡,精确分割道路具有挑战性。为应对这些挑战,关注重要纹理细节与感知全局几何上下文信息至关重要。近期研究表明,CNN-Transformer 混合结构优于单独使用 CNN 或 Transformer。CNN 擅长提取局部细节特征,而 Transformer 天然感知全局上下文信息。本文中,我们提出一种名为 ConSwin 的双分支网络模块,结合 ResNet 与 SwinTransformer 用于道路提取任务。该 ConSwin 模块利用两种方法的优势以更好地提取细节与全局特征。基于 ConSwin,我们构建了一个沙漏形道路提取网络,并引入两种新颖的连接结构,以更好地向解码器传递纹理与结构细节信息。我们所提方法在 Massachusetts 与 CHN6-CUG 数据集上的总体精度、IOU 和 F1 指标均优于最先进(state-of-the-art, SOTA)方法。额外实验验证了所提模块的有效性,而可视化结果展示了其获得更好道路表示的能力。
引用
@article{arxiv.2201.03178,
title = {Swin Transformer coupling CNNs Makes Strong Contextual Encoders for VHR Image Road Extraction},
author = {Tao Chen and Yiran Liu and Haoyu Jiang and Ruirui Li},
journal= {arXiv preprint arXiv:2201.03178},
year = {2023}
}