LPViT:面向视觉 Transformer 的低功耗半结构化剪枝
计算机视觉与模式识别
2025-04-16 v5
摘要
视觉 Transformer 已成为替代卷积神经网络的有前景的选择, 在各种图像分析任务中展现出与之相当或更优的性能。然而, ViT 的一个显著缺点是其资源密集型, 导致内存占用、 计算复杂度和功耗增加。 为让这项高性能技术更易于普及且更具环保性, 必须压缩 ViT 模型, 在保持高性能的同时降低其资源需求。 本文引入一种新的块状结构剪枝, 以解决 ViT 的资源密集问题, 在准确率与硬件加速之间实现平衡。 不同于非结构化剪枝或通道级结构化剪枝, 块状剪枝利用线性层的块状结构, 从而实现更高效的矩阵乘法。 为优化该剪枝方案, 本文提出一种新颖的硬件感知学习目标, 同时在推理过程中最大化加速速度并最小化功耗, 针对块稀疏结构进行优化。 该目标无需经验查找表, 仅聚焦于减少参数化层的连接。 此外, 本文提供一种轻量级算法, 实现 ViT 的后训练剪枝, 利用二阶 Taylor 近似和经验优化求解所提出的硬件感知目标。 在包括 DeiT-B 和 DeiT-S 在内的各种 ViT 架构上进行在 ImageNet 上的大量实验, 表明其在准确率保持与功耗节省之间取得了与其他剪枝方法相当的表现。 特别地, 在专用硬件和 GPU 上分别实现了 3.93 倍的加速, 且在 GPU 上实现了 1.4 倍的功耗降低。 代码已发布至 https://github.com/Akimoto-Cris/LPViT。
关键词
引用
@article{arxiv.2407.02068,
title = {LPViT: Low-Power Semi-structured Pruning for Vision Transformers},
author = {Kaixin Xu and Zhe Wang and Chunyun Chen and Xue Geng and Jie Lin and Mohamed M. Sabry Aly and Xulei Yang and Min Wu and Xiaoli Li and Weisi Lin},
journal= {arXiv preprint arXiv:2407.02068},
year = {2025}
}