中文

SegNeXt:重新思考语义分割中的卷积注意力设计

计算机视觉与模式识别 2022-09-20 v1

摘要

我们提出了 SegNeXt,一种用于语义分割的简单卷积网络架构。近期基于 transformer 的模型因自注意力在编码空间信息上的高效性而主导了语义分割领域。在本文中,我们表明卷积注意力比 transformer 中的自注意力机制更能高效且有效地编码上下文信息。通过重新审视成功分割模型所具有的特征,我们发现导致分割模型性能提升的几个关键组件。这促使我们设计一种使用廉价卷积操作的新型卷积注意力网络。无需额外技巧,我们的 SegNeXt 在包括 ADE20K、Cityscapes、COCO-Stuff、Pascal VOC、Pascal Context 和 iSAID 在内的流行基准上显著改进了先前 SOTA 方法的性能。值得注意的是,SegNeXt 优于 EfficientNet-L2 w/ NAS-FPN,并在 Pascal VOC 2012 测试排行榜上仅用其 1/10 的参数实现了 90.6% mIoU。平均而言,在 ADE20K 数据集上,SegNeXt 以相同或更少的计算量相比 SOTA 方法实现了约 2.0% mIoU 的提升。代码见 https://github.com/uyzhang/JSeg (Jittor) 与 https://github.com/Visual-Attention-Network/SegNeXt (Pytorch)。

关键词

引用

@article{arxiv.2209.08575,
  title  = {SegNeXt: Rethinking Convolutional Attention Design for Semantic Segmentation},
  author = {Meng-Hao Guo and Cheng-Ze Lu and Qibin Hou and Zhengning Liu and Ming-Ming Cheng and Shi-Min Hu},
  journal= {arXiv preprint arXiv:2209.08575},
  year   = {2022}
}

备注

SegNeXt, a simple CNN for semantic segmentation. Code is available