RIFormer:在移除令牌混合器的同时保持视觉骨干网络有效
计算机视觉与模式识别
2023-04-13 v1 人工智能
摘要
本文研究如何在其基本构建块中移除令牌混合器的同时保持视觉骨干网络有效。令牌混合器(如视觉Transformer(ViT)中的自注意力)旨在执行不同空间令牌之间的信息交流,但会带来可观的计算成本和延迟。然而,直接移除它们会导致模型结构先验不完整,从而带来显著的精度下降。为此,我们首先基于重参数化思想开发了RepIdentityFormer,以研究无令牌混合器的模型架构。随后我们探索改进的学习范式以打破简单无令牌混合器骨干网络的局限,并将经验做法总结为5条准则。配备所提出的优化策略,我们能够构建具有令人满意性能且推理高效的极简视觉骨干网络。大量实验和消融分析也表明,网络架构的归纳偏置可通过适当的优化策略融入简单网络结构。我们希望本工作能作为探索优化驱动高效网络设计的起点。项目页面:https://techmonsterwang.github.io/RIFormer/。
引用
@article{arxiv.2304.05659,
title = {RIFormer: Keep Your Vision Backbone Effective While Removing Token Mixer},
author = {Jiahao Wang and Songyang Zhang and Yong Liu and Taiqiang Wu and Yujiu Yang and Xihui Liu and Kai Chen and Ping Luo and Dahua Lin},
journal= {arXiv preprint arXiv:2304.05659},
year = {2023}
}
备注
8 pages, accepted by CVPR2023