ELSA:面向视觉 Transformer 的层级 N:M 稀疏化加速
计算机视觉与模式识别
2024-09-17 v1 机器学习
摘要
稀疏性是一种新兴的模型压缩方法,受益于越来越多的加速器支持,以加速深层神经网络中稀疏矩阵乘法。大多数现有的稀疏性方法为网络中所有层统一设置稀疏性,或通过考虑每层参数数量进行启发式确定层级配置。然而,很少有方法为获得面向支持稀疏性加速器的视觉 Transformer(ViT)的层级定制化稀疏配置而设计。在本工作中,为了解决为ViT在支持稀疏性加速器上选择合适稀疏配置的挑战,我们提出了ELSA,即面向ViT的层级稀疏性。考虑到给定加速器支持的所有稀疏性水平以及预期的吞吐量提升,我们的方法可以在ViT模型方面实现内存使用和推理时间的减少,同时以微小的准确度下降为代价。例如,我们的方法在ImageNet上对 Swin-B 和 DeiT-B 实现了显著的2.9倍 FLOPs 减少,仅出现轻微的准确度下降。我们的代码将在论文接受后公开。
引用
@article{arxiv.2409.09708,
title = {ELSA: Exploiting Layer-wise N:M Sparsity for Vision Transformer Acceleration},
author = {Ning-Chi Huang and Chi-Chih Chang and Wei-Cheng Lin and Endri Taka and Diana Marculescu and Kai-Chiang Wu},
journal= {arXiv preprint arXiv:2409.09708},
year = {2024}
}