自适应稀疏ViT:通过充分利用自注意力实现可学习的自适应令牌剪枝
计算机视觉与模式识别
2023-07-07 v2
摘要
视觉Transformer已成为计算机视觉中的一种新范式,在展现出优异性能的同时伴随着高昂的计算代价。图像令牌剪枝是ViT压缩的主要方法之一,因为复杂度相对于令牌数量呈二次增长,且许多仅包含背景区域的令牌并未真正对最终预测做出贡献。现有工作要么依赖额外模块对单个令牌的重要性打分,要么对不同输入实例采用固定的剪枝比例策略。在本工作中,我们提出了一种代价极小的自适应稀疏令牌剪枝框架。具体而言,我们首先提出一种廉价的注意力头重要性加权的类注意力打分机制。随后,插入可学习参数作为阈值以区分信息性令牌与非重要令牌。通过比较令牌注意力分数与阈值,我们可以分层丢弃无用令牌,从而加速推理。可学习阈值在预算感知训练中得到优化,以平衡精度与复杂度,并为不同输入实例执行相应的剪枝配置。大量实验证明了我们方法的有效性。我们的方法将DeiT-S的吞吐量提升了50%,且仅带来0.2%的top-1精度下降,相比以往方法在精度与延迟之间实现了更好的权衡。
引用
@article{arxiv.2209.13802,
title = {Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully Exploiting Self-Attention},
author = {Xiangcheng Liu and Tianyi Wu and Guodong Guo},
journal= {arXiv preprint arXiv:2209.13802},
year = {2023}
}
备注
Accepted by IJCAI2023. Code URL: https://github.com/Cydia2018/AS-ViT