中文

SkipViT:利用 Token 级跳跃连接加速 Vision Transformer

计算机视觉与模式识别 2024-01-30 v1 人工智能 机器学习

摘要

众所周知,Vision Transformer 在计算量和数据量上比 CNN 模型更为密集。ViT 等这些 Transformer 模型需要所有输入图像 token 来学习它们之间的关系。然而,这些 token 中有许多并不包含信息,可能包含无关信息,例如不相关的背景或不重要的景物。这些 token 被多头自注意力(MHSA)忽略,导致 MHSA 和前馈网络(FFN)中产生许多冗余且不必要的计算。在这项工作中,我们提出一种方法,通过将不重要的 token 分离并经由一条不同的低成本计算路径发送,来优化它们之间不必要的交互量。我们的方法不为 ViT 模型增加任何参数,旨在寻找训练吞吐量与最终模型 Top-1 准确率零损失之间的最佳权衡。我们在华为 Ascend910A 上从头训练 ViT-small 的实验结果表明,SkipViT 能够有效丢弃 55% 的 token,同时获得超过 13% 的训练吞吐量提升,并保持分类准确率处于基线模型水平。

关键词

引用

@article{arxiv.2401.15293,
  title  = {SkipViT: Speeding Up Vision Transformers with a Token-Level Skip Connection},
  author = {Foozhan Ataiefard and Walid Ahmed and Habib Hajimolahoseini and Saina Asani and Farnoosh Javadi and Mohammad Hassanpour and Omar Mohamed Awad and Austin Wen and Kangling Liu and Yang Liu},
  journal= {arXiv preprint arXiv:2401.15293},
  year   = {2024}
}