中文

视觉 Transformer 的多维模型压缩

计算机视觉与模式识别 2022-01-04 v1 机器学习

摘要

视觉 Transformer(ViT)近期引起了相当多的关注,但巨大的计算代价仍是实际部署中的一个问题。以往的 ViT 剪枝方法倾向于仅沿单一维度剪枝模型,这可能遭受过度缩减并导致次优的模型质量。相比之下,我们倡导一种多维 ViT 压缩范式,并提议联合利用来自注意力头、神经元和序列维度的冗余减少。我们首先提出一种基于统计依赖的剪枝准则,该准则可推广至不同维度以识别有害组件。此外,我们将多维压缩视为一个优化问题,学习跨三个维度的最优剪枝策略,以在計算预算下最大化压缩模型的精度。该问题由我们改进的高斯过程搜索与期望改进求解。实验结果表明,我们的方法有效降低了各种 ViT 模型的计算代价。例如,我们的方法在 DeiT 和 T2T-ViT 模型上减少 40% FLOPs 而无 top-1 精度损失,优于以往的最先进技术。

关键词

引用

@article{arxiv.2201.00043,
  title  = {Multi-Dimensional Model Compression of Vision Transformer},
  author = {Zejiang Hou and Sun-Yuan Kung},
  journal= {arXiv preprint arXiv:2201.00043},
  year   = {2022}
}