SSformer:一种用于语义分割的轻量型 Transformer
计算机视觉与模式识别
2022-08-04 v1
摘要
人们普遍相信,在语义分割方面 Transformer 优于卷积神经网络。然而,原始的 Vision Transformer 可能缺乏局部邻域的归纳偏置且具有较高的时间复杂度。近来,Swin Transformer 通过使用分层架构和移位窗口在各种视觉任务中创下新纪录,同时更高效。然而,由于 Swin Transformer 专为图像分类设计,它在基于密集预测的分割任务上可能取得次优性能。此外,简单地将 Swin Transformer 与现有方法结合会导致最终分割模型尺寸和参数的增加。在本文中,我们重新思考用于语义分割的 Swin Transformer,并设计了一个轻量且高效的 Transformer 模型,称为 SSformer。在该模型中,考虑到 Swin Transformer 固有的分层设计,我们提出一个解码器来聚合来自不同层的信息,从而获得局部和全局注意力。实验结果表明,所提出的 SSformer 取得了与最先进(SOTA)模型相当的 mIoU 性能,同时保持了更小的模型规模和更低的计算量。
引用
@article{arxiv.2208.02034,
title = {SSformer: A Lightweight Transformer for Semantic Segmentation},
author = {Wentao Shi and Jing Xu and Pan Gao},
journal= {arXiv preprint arXiv:2208.02034},
year = {2022}
}