中文

PRANCE:面向自适应ViT推理的联合token优化与结构通道剪枝

计算机视觉与模式识别 2024-07-09 v1

摘要

我们介绍PRANCE,这是一种Vision Transformer压缩框架,基于输入特征 jointly优化激活通道并减少token数。具体而言,PRANCE利用自适应token优化策略,在一定计算预算下,旨在从统一的数据和架构视角加速ViT的推理。然而,联合框架在架构和决策两个方面都面临挑战。首先,尽管ViT本身支持可变token推理,但不利于可变通道的动态计算。为克服这一限制,我们提出一种使用权共享技术的meta网络,以支持Multi-head Self-Attention和Multi-layer Perceptron层的任意通道,作为架构决策的基础模型。其次,同时优化meta网络的结构和输入数据构成一个决策空间极大(约达到101410^{14})的组合优化问题,使得监督学习不可行。为此,我们设计一种轻量级选择器,采用近端策略优化(Proximal Policy Optimization)进行高效决策。此外,我们引入一种新的"Result-to-Go"训练机制,将ViT推理过程建模为马尔可夫决策过程,显著减少动作空间并缓解训练期间的延迟奖励问题。广泛的实验表明,PRANCE在将FLOPs约减50%的同时,仅保留约10%的token,即可实现无损Top-1准确率。此外,我们的框架与各种token优化技术(如剪枝、合并和顺序剪枝-合并策略)兼容。代码已公开于 https://github.com/ChildTang/PRANCE。

关键词

引用

@article{arxiv.2407.05010,
  title  = {PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference},
  author = {Ye Li and Chen Tang and Yuan Meng and Jiajun Fan and Zenghao Chai and Xinzhu Ma and Zhi Wang and Wenwu Zhu},
  journal= {arXiv preprint arXiv:2407.05010},
  year   = {2024}
}