探索并改进移动端视觉Transformer
计算机视觉与模式识别
2021-08-31 v1
摘要
本文研究了移动端层面的视觉Transformer结构,并发现其性能出现剧烈下降。我们分析了该现象背后的原因,提出了一种新颖的不规则块嵌入模块和自适应块融合模块以提升性能。我们推测,视觉Transformer块(由多头注意力和前馈网络组成)比处理低级特征更适合处理高级信息。不规则块嵌入模块以不同感受野提取包含丰富高级信息的块。Transformer块可从这些不规则块中获取最有用的信息。随后,处理后的块经过自适应块合并模块得到供分类器使用的最终特征。借助我们所提出的改进,传统的均匀视觉Transformer结构在移动端层面可达到最先进(state-of-the-art)结果。在移动端设置下,我们将DeiT基线提升了超过9%,并大幅超越Swin和CoaT等其他Transformer架构。
引用
@article{arxiv.2108.13015,
title = {Exploring and Improving Mobile Level Vision Transformers},
author = {Pengguang Chen and Yixin Chen and Shu Liu and Mingchang Yang and Jiaya Jia},
journal= {arXiv preprint arXiv:2108.13015},
year = {2021}
}
备注
10 pages; 5 figures; preprint