CP-ViT:基于渐进稀疏性预测级联视觉 Transformer 剪枝
计算机视觉与模式识别
2022-03-10 v1 人工智能
摘要
视觉 Transformer(ViT)已在多种计算机视觉应用中取得有竞争力的精度,但其计算成本阻碍了在资源受限移动设备上的部署。我们探究了 ViT 中的稀疏性,并观察到信息丰富的图像块与注意力头足以用于准确的图像识别。本文中,我们提出了一种名为 CP-ViT 的级联剪枝框架,通过渐进且动态地预测 ViT 模型中的稀疏性,以降低计算冗余同时将精度损失最小化。具体而言,我们定义累积分数以在 ViT 模型中保留信息丰富的图像块与注意力头,从而获得更好精度。我们还提出了基于层感知注意力范围的动态剪枝率调整技术。CP-ViT 对实际部署具有很强通用性,可应用于广泛的 ViT 模型,并能在有无微调情况下均取得优越精度。在 ImageNet、CIFAR-10 与 CIFAR-100 上使用多种预训练模型的大量实验已证明了 CP-ViT 的有效性与高效性。通过渐进剪枝 50\% 图像块,我们的 CP-ViT 方法减少了超过 40\% 的 FLOPs,同时将精度损失维持在 1\% 以内。
引用
@article{arxiv.2203.04570,
title = {CP-ViT: Cascade Vision Transformer Pruning via Progressive Sparsity Prediction},
author = {Zhuoran Song and Yihong Xu and Zhezhi He and Li Jiang and Naifeng Jing and Xiaoyao Liang},
journal= {arXiv preprint arXiv:2203.04570},
year = {2022}
}