中文

自瘦身视觉Transformer

计算机视觉与模式识别 2022-09-13 v3

摘要

视觉Transformer(ViTs)已成为流行的结构,并在各种视觉任务上超越了卷积神经网络(CNNs)。然而,这种强大的Transformer带来了巨大的计算负担,因为其存在耗时的令牌间比较。先前的工作侧重于丢弃不重要的令牌以降低ViTs的计算成本。但当丢弃率增加时,这种硬性方式将不可避免地丢弃关键令牌,从而限制了其效率。为了解决这个问题,我们为普通ViTs提出了一种通用的自瘦身学习方法,即SiT。具体来说,我们首先设计了一个新颖的令牌瘦身模块(TSM),它可以通过动态令牌聚合来提高ViTs的推理效率。作为令牌硬丢弃的通用方法,我们的TSM将冗余令牌软性地整合到更少的信息性令牌中。即使在高瘦身率下,它也能动态缩放视觉注意力,而不会切断图像中的判别性令牌关系。此外,我们引入了一个简洁的特征重校准蒸馏(FRD)框架,其中我们设计了TSM的反向版本(RTSM),以灵活的自动编码器方式重校准非结构化令牌。由于教师和学生模型结构相似,我们的FRD可以有效地利用结构知识以获得更好的收敛性。最后,我们进行了大量实验来评估我们的SiT。结果表明,我们的方法可以将ViTs加速1.7倍,而精度下降可忽略不计,甚至可以在保持97%性能的同时将ViTs加速3.6倍。令人惊讶的是,只需将LV-ViT与我们的SiT结合,我们就在ImageNet上取得了新的最先进性能。代码可在https://github.com/Sense-X/SiT获取。

关键词

引用

@article{arxiv.2111.12624,
  title  = {Self-slimmed Vision Transformer},
  author = {Zhuofan Zong and Kunchang Li and Guanglu Song and Yali Wang and Yu Qiao and Biao Leng and Yu Liu},
  journal= {arXiv preprint arXiv:2111.12624},
  year   = {2022}
}

备注

Accepted by ECCV 2022. Code is available at https://github.com/Sense-X/SiT