稀疏-BitNet:1.58 位 LLM 天然适合于半结构稀疏性
计算与语言
2026-03-06 v1
摘要
半结构 N:M 稀疏和低位量化(如 1.58 位 BitNet)是两种提高大型语言模型(LLM)效率的有前景的方法,但它们大多在孤立的情况下研究。在本工作中,我们研究了它们的相互作用,表明 1.58 位 BitNet 在与 N:M 稀疏性的兼容性上天然优于全精度模型。为研究这一效果,我们提出了 Sparse-BitNet,一个统一的框架,同时应用 1.58 位量化和动态 N:M 稀疏化,首次确保了稳定的训练。在多个模型规模和训练方案(稀疏预训练和稠密到稀疏计划)下,1.58 位 BitNet 在相同稀疏度下的性能下降均小于全精度基准,并在准确率崩溃前能够容忍更高的结构稀疏。此外,利用我们的自定义稀疏张量核心,Sparse-BitNet 在训练和推理中实现了显著加速,最高可达 1.30 倍。这些结果凸显了将极低位量化与半结构 N:M 稀疏性结合是提高 LLM 效率的有前景的方向。代码可在 https://github.com/AAzdi/Sparse-BitNet 获取。
引用
@article{arxiv.2603.05168,
title = {Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity},
author = {Di Zhang and Xun Wu and Shaohan Huang and Yudong Wang and Hanyong Shao and Yingbo Hao and Zewen Chi and Li Dong and Ting Song and Yan Xia and Zhifang Sui and Furu Wei},
journal= {arXiv preprint arXiv:2603.05168},
year = {2026}
}