基于 Hessian 感知显著性的全局视觉 Transformer 剪枝
计算机视觉与模式识别
2023-03-31 v2
摘要
Transformer 在诸多任务上取得了最先进的结果。然而,其启发式设计的架构在推理过程中带来了巨大的计算开销。本工作旨在挑战视觉 Transformer (ViT) 模型在某一模型阶段所有堆叠块维度统一这一常见设计理念,通过首次系统性尝试全局结构剪枝,在 Transformer 块之间以及块内不同结构之间重新分配参数。针对多样的 ViT 结构组件,我们推导了一种新颖的基于 Hessian 的结构剪枝准则,可在所有层和结构间进行比较,并带有延迟感知正则化以直接降低延迟。对 DeiT-Base 模型进行迭代剪枝,产生了一个称为 NViT (Novel ViT) 的新架构族,其具有一种利用参数更为高效的新型参数重分配方案。在 ImageNet-1K 上,NViT-Base 以近乎无损的方式相比 DeiT-Base 模型实现了 2.6 倍 FLOPs 降低、5.1 倍参数降低和 1.9 倍运行时间加速。更小的 NViT 变体在 DeiT Small/Tiny 变体相同吞吐量下取得了超过 1% 的准确率提升,并对 SWIN-Small 模型实现了无损的 3.3 倍参数降低。这些结果大幅优于先前方法。进一步对 NViT 的参数重分配机理进行了分析,我们展示了 ViT 模型的高可剪枝性、ViT 块内差异化的敏感性,以及跨堆叠 ViT 块的独特参数分布趋势。我们的洞见为朝向更高效 ViT 以实现即用型性能提升的一种简单而有效的参数重分配规则提供了可行性。
引用
@article{arxiv.2110.04869,
title = {Global Vision Transformer Pruning with Hessian-Aware Saliency},
author = {Huanrui Yang and Hongxu Yin and Maying Shen and Pavlo Molchanov and Hai Li and Jan Kautz},
journal= {arXiv preprint arXiv:2110.04869},
year = {2023}
}
备注
Accepted as a conference paper at CVPR 2023