SlideSparse:快速且灵活的 (2N-2):2N 结构稀疏
机器学习
2026-03-06 v1
摘要
NVIDIA 的 2:4 稀疏张量核心提供 2 倍吞吐量,但要求严格的 50% 剪枝 ratio,这一比例会导致 LLM 推理准确率下降(Qwen3:从 54% 降至 15%)。更温和的 (2N-2):2N 模式(如 6:8,25% 剪枝)保留准确率却无硬件支持,退化为稠密执行,无法从稀疏性中获益。我们提出的 SlideSparse 是首个在常规 GPU 上解锁 (2N-2):2N 模型家族稀疏张量核心加速的系统。通过滑动窗口分解(Sliding Window Decomposition),将任意 (2N-2):2N 权重块重构为 N-1 个重叠的 2:4 合规窗口,实现接近零精度损失的加速;通过激活提升(Activation Lifting),将相应的激活重排融合到逐 token 量化中。集成到 vLLM 中,SlideSparse 在 various GPU(A100、H100、B200、RTX 4090、RTX 5080、DGX-spark)、various precisions(FP4、INT8、FP8、BF16、FP16)以及 various model families(Llama、Qwen、BitNet)上进行评估。在计算受限的工作负载上,测量的加速比(1.33x)接近理论上界 N/(N-1)=4/3 在 Qwen2.5-7B 中的 6:8 权重稀疝下,确立了 (2N-2):2N 成为保留准确率的 LLM 加速的实用路径。代码已公开于 https://github.com/bcacdwk/vllmbench。
引用
@article{arxiv.2603.05232,
title = {SlideSparse: Fast and Flexible (2N-2):2N Structured Sparsity},
author = {Hanyong Shao and Yingbo Hao and Ting Song and Yan Xia and Di Zhang and Shaohan Huang and Xun Wu and Songchen Xu and Le Xu and Li Dong and Zewen Chi and Yi Zou and Furu Wei},
journal= {arXiv preprint arXiv:2603.05232},
year = {2026}
}