超越2:4:探索V:N:M稀疏性以实现GPU上的高效Transformer推理
机器学习
2025-06-04 v3 人工智能
摘要
迄今为止,2:4稀疏性是唯一可使用稀疏张量核心在GPU上加速的稀疏模式。在实际应用中,2:4稀疏性往往具有较低的实际加速比(),且需要固定稀疏比,这意味着其他稀疏比(如4:8、8:16或超过50%稀疏)在GPU上不会产生加速。最近的研究表明,V:N:M稀疏性在缓解2:4稀疏性的局限性方面具有前景。然而,关于V:N:M稀疏性在更广泛的Transformer模型(如视觉Transformer和大语言模型LLM)上的准确性影响,研究仍寡言少见。此外,一些与V:N:M稀疏性相关的具体问题(如如何选择合适的V和M值)尚未得到解决。本研究系统性地探索了V:N:M稀疏性在视觉模型和LLM中的应用,涵盖从下游任务的各种应用场景。我们提出了三种关键方法来提高V:N:M稀疏Transformer的适用性和准确性,包括启发式V和M选择、V:N:M特定的通道置换以及三阶段LoRA训练技术。实验结果表明,在我们的技术方法下,DeiT-small在64:2:5稀疏性下实现了无损精度,而DeiT-base在64:2:8稀疏性下仍能保持准确性。此外,在64:2:5稀疏性下微调的LLama2-7B在下游任务上的表现与无训练的2:4稀疏方案相当或更好。更重要的是,V:N:M稀疏Transformer提供的加速-精度权衡范围优于2:4稀疏性。总体而言,我们的探索大大促进了V:N:M稀疏性在成本敏感的推理场景中作为真正有效加速方案的应用。
引用
@article{arxiv.2410.16135,
title = {Beyond 2:4: exploring V:N:M sparsity for efficient transformer inference on GPUs},
author = {Kang Zhao and Tao Yuan and Han Bao and Zhenfeng Su and Chang Gao and Zhaofeng Sun and Zichen Liang and Liping Jing and Jianfei Chen},
journal= {arXiv preprint arXiv:2410.16135},
year = {2025}
}