中文

并非所有图像块都必要:通过令牌重组加速视觉Transformer

计算机视觉与模式识别 2022-04-15 v2 机器学习

摘要

视觉Transformer(ViTs)将所有图像块作为令牌,并在它们之间构建多头自注意力(MHSA)。对这些图像令牌的充分利用带来了冗余计算,因为并非所有令牌在 MHSA 中都受关注。例如,包含语义无意义或干扰性图像背景的令牌对 ViT 预测无正向贡献。本工作中,我们提出在 ViT 模型的前向过程中重组图像令牌,并在训练时集成到 ViT 中。对于每次前向推理,我们识别 MHSA 与 FFN(即前馈网络)模块间受关注的图像令牌,这由相应的类令牌注意力引导。然后,我们通过保留受关注图像令牌并融合不受关注令牌来重组图像令牌,以加速后续 MHSA 和 FFN 计算。为此,我们的方法 EViT 从两个角度改进 ViT。首先,在输入图像令牌数量相同的情况下,我们的方法减少了 MHSA 和 FFN 计算以实现高效推理。例如,DeiT-S 的推理速度提升 50%,而其在 ImageNet 分类上的识别准确率仅下降 0.3%。其次,在保持相同计算成本下,我们的方法使 ViT 能输入更多图像令牌以提升识别准确率,这些图像令牌来自更高分辨率图像。例如,我们在与原始 DeiT-S 相同计算成本下将 DeiT-S 的 ImageNet 分类识别准确率提升 1%。同时,我们的方法未给 ViT 引入更多参数。标准基准上的实验显示了我们方法的有效性。代码见 https://github.com/youweiliang/evit

关键词

引用

@article{arxiv.2202.07800,
  title  = {Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations},
  author = {Youwei Liang and Chongjian Ge and Zhan Tong and Yibing Song and Jue Wang and Pengtao Xie},
  journal= {arXiv preprint arXiv:2202.07800},
  year   = {2022}
}

备注

ICLR 2022 Spotlight