中文

SparseForge:基于Hessian引导软掩码退火的高效半结构化LLM稀疏化

机器学习 2026-05-08 v1

摘要

半结构化稀疏性为利用原生硬件支持加速大型语言模型(LLM)提供了一条实用途径,但由于强烈的结构耦合,训练后半结构化剪枝通常会遭受显著的质量下降。现有方法依赖大规模稀疏重训练以恢复准确率,导致计算成本高昂。我们提出了SparseForge,这是一个通过直接优化稀疏掩码而非扩大重训练token规模来提高恢复效率的训练后框架。SparseForge将Hessian感知重要性估计与软掩码向硬件可执行结构化稀疏的渐进退火相结合,实现了稳定且高效的稀疏恢复。在2:4稀疏度下的LLaMA-2-7B上,SparseForge仅使用5B\textbf{5B}个重训练token便实现了57.27%的平均零样本准确率,超越了稠密模型56.43%的准确率,并接近使用40B\textbf{40B}个token的最先进方法所取得的57.52%的结果。SparseForge在准确率与效率权衡上的这种改进被证明在不同模型家族间是一致的。

关键词

引用

@article{arxiv.2605.06402,
  title  = {SparseForge: Efficient Semi-Structured LLM Sparsification via Annealing of Hessian-Guided Soft-Mask},
  author = {Liu Hanzuo and Chaofan Lin and Weixuan Sun and Yulong Wang and Key and Rayying and Mingyu Gao},
  journal= {arXiv preprint arXiv:2605.06402},
  year   = {2026}
}