SegFormer:基于Transformers的简洁高效语义分割设计
计算机视觉与模式识别
2021-10-29 v3 机器学习
摘要
我们提出SegFormer,一个简洁、高效且强大的语义分割框架,它将Transformers与轻量多层感知机(MLP)解码器相统一。SegFormer具有两个引人注目的特性:1) SegFormer包含一种新颖的分层结构Transformer编码器,其输出多尺度特征。它不需要位置编码,从而避免了位置码插值在测试分辨率与训练不同时导致性能下降的问题。2) SegFormer避免了复杂的解码器。所提出的MLP解码器从不同层聚合信息,从而结合局部注意力与全局注意力以产生强大的表征。我们表明这一简洁轻量的设计是Transformers上高效分割的关键。我们将方法扩展得到从SegFormer-B0到SegFormer-B5的一系列模型,取得显著优于以往方法的性能与效率。例如,SegFormer-B4在ADE20K上以64M参数达到50.3% mIoU,比先前最佳方法小5倍且优2.2%。我们的最佳模型SegFormer-B5在Cityscapes验证集上达到84.0% mIoU,并在Cityscapes-C上展现出优异的零样本鲁棒性。代码将发布于:github.com/NVlabs/SegFormer。
引用
@article{arxiv.2105.15203,
title = {SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers},
author = {Enze Xie and Wenhai Wang and Zhiding Yu and Anima Anandkumar and Jose M. Alvarez and Ping Luo},
journal= {arXiv preprint arXiv:2105.15203},
year = {2021}
}
备注
Accepted by NeurIPS 2021