Evo-ViT:用于动态视觉Transformer的慢-快令牌演化
计算机视觉与模式识别
2021-12-07 v5
摘要
视觉Transformer(ViT)最近获得了爆炸性的流行,但巨大的计算成本仍然是一个严重问题。由于ViT的计算复杂度与输入序列长度成二次方关系,减少计算量的主流范式是减少令牌数量。现有设计包括结构化空间压缩(使用渐进收缩金字塔减少大特征图的计算)和非结构化令牌剪枝(动态丢弃冗余令牌)。然而,现有令牌剪枝的局限性在于两个方面:1)剪枝导致的不完整空间结构与现代深窄Transformer中常用的结构化空间压缩不兼容;2)它通常需要耗时的预训练过程。为了解决这些局限性并扩展令牌剪枝的适用场景,我们提出了Evo-ViT,一种用于视觉Transformer的自我驱动的慢-快令牌演化方法。具体来说,我们利用视觉Transformer固有的简单有效的全局类别注意力进行非结构化实例级令牌选择。然后,我们提出用不同的计算路径更新选定的信息令牌和非信息令牌,即慢-快更新。由于慢-快更新机制保持了空间结构和信息流,Evo-ViT可以从训练过程一开始就加速平坦和深窄结构的普通Transformer。实验结果表明,我们的方法在显著降低视觉Transformer计算成本的同时,在图像分类上保持了可比的性能。
关键词
引用
@article{arxiv.2108.01390,
title = {Evo-ViT: Slow-Fast Token Evolution for Dynamic Vision Transformer},
author = {Yifan Xu and Zhijie Zhang and Mengdan Zhang and Kekai Sheng and Ke Li and Weiming Dong and Liqing Zhang and Changsheng Xu and Xing Sun},
journal= {arXiv preprint arXiv:2108.01390},
year = {2021}
}
备注
We propose a novel and effective design for dynamic vision transformer to achieve better computational efficiency. The code is available at https://github.com/YifanXu74/Evo-ViT