中文

基于异构注意力模式的视觉 Transformer 加速

计算机视觉与模式识别 2023-10-12 v1

摘要

近来,视觉 Transformer(ViTs)在计算机视觉领域引起了大量关注。一般而言,ViTs 强大的表征能力主要得益于具有高计算复杂度的自注意力机制。为加速 ViTs,我们基于跨层观测到的异构注意力模式提出一种集成压缩流程。一方面,不同图像在较浅层比在较深层共享更相似的注意力模式,表明在较浅层动态查询-键自注意力矩阵可被静态自注意力矩阵替代。随后,我们提出动态引导静态自注意力(DGSSA)方法,该矩阵从被替代的动态自注意力继承自注意力信息,以有效提升 ViTs 的特征表征能力。另一方面,较深层比浅层具有更多反映 token 冗余的低秩注意力模式。从线性降维视角,我们进一步提出全局聚合金字塔(GLAD)方法以减少 ViTs(如 DeiT)较深层中的 token 数量。实验上,DGSSA 与 GLAD 的集成压缩流程相比 DeiT 可加速达 121% 的运行吞吐量,超越了所有 SOTA 方法。

关键词

引用

@article{arxiv.2310.07664,
  title  = {Accelerating Vision Transformers Based on Heterogeneous Attention Patterns},
  author = {Deli Yu and Teng Xi and Jianwei Li and Baopu Li and Gang Zhang and Haocheng Feng and Junyu Han and Jingtuo Liu and Errui Ding and Jingdong Wang},
  journal= {arXiv preprint arXiv:2310.07664},
  year   = {2023}
}