TopFormer:面向移动端语义分割的令牌金字塔 Transformer
计算机视觉与模式识别
2022-04-13 v1
摘要
尽管视觉 Transformer(ViT)在计算机视觉中已取得巨大成功,其沉重计算成本阻碍了它们在移动设备上语义分割等密集预测任务中的应用。本文提出一种名为 \textbf{To}ken \textbf{P}yramid Vision Trans\textbf{former}(\textbf{TopFormer})的移动端友好架构。所提 \textbf{TopFormer} 以多尺度令牌(Token)作为输入以生成尺度感知语义特征,随后将其注入对应令牌以增强表示。实验结果表明,我们的方法在多个语义分割数据集上显著优于基于 CNN 与 ViT 的网络,并在精度与延迟间取得良好权衡。在 ADE20K 数据集上,TopFormer 在基于 ARM 的移动设备上以更低延迟取得比 MobileNetV3 高 5\% 的 mIoU 精度。此外,TopFormer 的微小版本在基于 ARM 的移动设备上以具竞争力结果实现实时推理。代码与模型见:https://github.com/hustvl/TopFormer
引用
@article{arxiv.2204.05525,
title = {TopFormer: Token Pyramid Transformer for Mobile Semantic Segmentation},
author = {Wenqiang Zhang and Zilong Huang and Guozhong Luo and Tao Chen and Xinggang Wang and Wenyu Liu and Gang Yu and Chunhua Shen},
journal= {arXiv preprint arXiv:2204.05525},
year = {2022}
}
备注
To Appear at CVPR 2022