中文

RTFormer:一种用于实时语义分割的高效Transformer设计

计算机视觉与模式识别 2022-10-14 v1

摘要

近年来,基于Transformer的网络在语义分割中展现出令人印象深刻的成果。然而在实时语义分割领域,由于Transformer耗时的计算机制,纯CNN-based方法仍占据主导。我们提出RTFormer,一种用于实时语义分割的高效双分辨率Transformer,相比基于CNN的模型在性能与效率间取得了更好权衡。为在类GPU设备上实现高推理效率,我们的RTFormer采用具有线性复杂度的GPU友好注意力并舍弃了多头机制。此外,我们发现跨分辨率注意力通过将低分辨率分支学到的高层知识传播给高分辨率分支,能更高效地为高分辨率分支聚合全局上下文信息。在主流基准上的大量实验证明了我们所提RTFormer的有效性,它在Cityscapes、CamVid和COCOStuff上取得了最先进性能,并在ADE20K上展现出有前景的结果。代码已发布于PaddleSeg: https://github.com/PaddlePaddle/PaddleSeg。

关键词

引用

@article{arxiv.2210.07124,
  title  = {RTFormer: Efficient Design for Real-Time Semantic Segmentation with Transformer},
  author = {Jian Wang and Chenhui Gou and Qiman Wu and Haocheng Feng and Junyu Han and Errui Ding and Jingdong Wang},
  journal= {arXiv preprint arXiv:2210.07124},
  year   = {2022}
}

备注

NeurIPS2022