中文

Zero-TPrune:基于预训练 Transformer 注意力图的零样本词元剪枝

计算机视觉与模式识别 2024-04-09 v3 人工智能 机器学习 图像与视频处理

摘要

由于推理成本随输入序列中词元数量呈二次方增长,Transformer 模型在边缘设备上的部署正变得愈发困难。词元剪枝因易于在各种 Transformer 骨干网络上部署而成为应对该挑战的新兴方案。然而,多数词元剪枝方法需要计算代价高昂的微调,这在许多边缘部署场景中并不可取。本工作中,我们提出 Zero-TPrune,首个在词元剪枝中同时考虑词元重要性与相似性的零样本方法。它利用预训练 Transformer 模型的注意力图,通过我们提出的加权 PageRank(WPR)算法为词元生成重要性分布。该分布进一步引导基于相似性的高效词元划分剪枝。由于消除了微调开销,Zero-TPrune 能以可忽略的计算成本剪枝大型模型、以零计算成本切换不同剪枝配置,并高效进行超参数调优。我们在视觉任务上通过将 Zero-TPrune 应用于多种视觉 Transformer 骨干网络并在 ImageNet 上测试来评估其性能。无需任何微调,Zero-TPrune 将 DeiT-S 的 FLOPs 成本降低 34.7%,吞吐量提升 45.3%,且仅损失 0.4% 精度。与需微调的先进剪枝方法相比,Zero-TPrune 不仅免除了剪枝后的微调需求,且精度损失仅 0.1%。与先进的免微调剪枝方法相比,在相似 FLOPs 预算下,Zero-TPrune 将精度损失最多降低 49%。项目主页:https://jha-lab.github.io/zerotprune。

关键词

引用

@article{arxiv.2305.17328,
  title  = {Zero-TPrune: Zero-Shot Token Pruning through Leveraging of the Attention Graph in Pre-Trained Transformers},
  author = {Hongjie Wang and Bhishma Dedhia and Niraj K. Jha},
  journal= {arXiv preprint arXiv:2305.17328},
  year   = {2024}
}

备注

IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024