中文

CAST:面向大语言模型的连续且可微的半结构化稀疏感知训练

机器学习 2025-10-01 v1 计算与语言

摘要

稀疏感知训练是将大语言模型转化为硬件友好的稀疏模式,从而降低推理过程中的延迟和内存消耗的有效方法。在本文中,我们提出了连续自适应稀疏训练器,这是一个用于半结构化(或“N:M”)稀疏模型的完全连续且可微的稀疏感知训练框架。与以往分别优化稀疏模式和权重的方法不同,CAST 能够在训练期间实现无缝的联合优化,同时逐步将模型转换为所需的稀疏格式。具体而言,CAST 引入了三个关键组件:1) AdamS,一种利用自适应 L1 衰减来促进所有参数均匀稀疏化的稀疏感知优化器;2) 权重缩放,一个旨在减轻由衰减引起的幅度减小同时保持所需稀疏模式的模块;3) 知识蒸馏,它采用稠密模型作为自教师来提高训练效率。我们在多个模型系列中评估了 CAST 在 2:4 稀疏模式下的表现,参数规模从 125M 到 13B 不等。我们的结果表明,在仅使用极少训练资源的情况下,该方法在困惑度和零样本准确率方面均显著优于以往的最先进方法。值得注意的是,在 LLaMA2-7B 上,仅使用原始预训练 token 的 2%,我们的 2:4 稀疏模型与稠密模型相比,困惑率仅增加了 0.09,零样本准确率提升了 0.36%。此外,我们建立了一条准确且稳健的经验缩放律,以在给定充足训练资源的情况下预测稀疏模型的性能。最后,我们通过在量化和微调场景下评估我们的稀疏模型,证明了其实用性。

关键词

引用

@article{arxiv.2509.25996,
  title  = {CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models},
  author = {Weiyu Huang and Yuezhou Hu and Jun Zhu and Jianfei Chen},
  journal= {arXiv preprint arXiv:2509.25996},
  year   = {2025}
}

备注

Submitted to IEEE TPAMI