IncepFormer:用于语义分割的带金字塔池化的高效 Inception Transformer
计算机视觉与模式识别
2022-12-07 v1
摘要
语义分割通常受益于全局上下文、精细定位信息、多尺度特征等。为在这些方面推进基于 Transformer 的分割器,我们提出一种简洁而强大的语义分割架构,称为 IncepFormer。IncepFormer 有两个关键贡献如下。首先,它引入了一种新颖的金字塔结构 Transformer 编码器,可同时获取全局上下文与精细定位特征。这些特征被拼接并送入卷积层以进行最终的逐像素预测。其次,IncepFormer 在每个自注意力层中集成了带有深度可分离卷积的类 Inception 架构以及一个轻量级前馈模块,高效获得丰富的局部多尺度目标特征。在五个基准上的大量实验表明,我们的 IncepFormer 在精度与速度上均优于最先进(state-of-the-art)方法,例如:1)我们的 IncepFormer-S 在 ADE20K 上达到 47.7% mIoU,优于现有最佳方法 1%,而仅耗费一半参数量与更少 FLOPs。2)我们的 IncepFormer-B 最终在 Cityscapes 数据集上以 39.6M 参数达到 82.0% mIoU。代码可用:github.com/shendu0321/IncepFormer。
引用
@article{arxiv.2212.03035,
title = {IncepFormer: Efficient Inception Transformer with Pyramid Pooling for Semantic Segmentation},
author = {Lihua Fu and Haoyue Tian and Xiangping Bryce Zhai and Pan Gao and Xiaojiang Peng},
journal= {arXiv preprint arXiv:2212.03035},
year = {2022}
}
备注
Preprint with 8 pages of main body and 3 pages of supplementary material