从 2:4 到 8:16 稀疏模式在 LLM 中的异常值与权重及方差校正
机器学习
2026-04-21 v2 人工智能
摘要
随着大语言模型(LLM)规模的不断增大,量化和稀疏化等高效压缩技术变得至关重要。虽然量化通过降低精度来保持性能,但结构化稀疏方法(如 N:M 稀疏化)常常因灵活性受限和对异常权重的敏感性而难以达到预期效果。我们探索了 8:16 半结构化稀疏,证明其能够超越性能阈值——即在相同内存约束下,压缩模型的准确率与其未压缩或更小规模模型相当。相较于 2:4 稀疏,8:16 在存储开销最小化的同时提供了更大的灵活性(0.875 与 0.75 位/元素)。我们还对显著权重应用稀疏结构模式,表明针对异常值的结构化稀疏在与非结构化方法相当或更优的结果方面具有竞争力。最后,我们展示了方差校正等简单技术,以及类似 SmoothQuant 的权重均衡,如何提升稀疏模型的性能。
引用
@article{arxiv.2507.03052,
title = {From 2:4 to 8:16 sparsity patterns in LLMs for Outliers and Weights with Variance Correction},
author = {Egor Maximov and Yulia Kuzkina and Azamat Kanametov and Alexander Prutko and Aleksei Goncharov and Maxim Zhelnin and Egor Shvetsov},
journal= {arXiv preprint arXiv:2507.03052},
year = {2026}
}