中文

ActTail:大型语言模型中的全局激活稀疏性

计算与语言 2026-03-16 v1 机器学习

摘要

激活稀疏性是一种有前景的加速大型语言模型(LLM)推理的方法,通过减少计算和内存传输来提高效率。然而,现有的激活稀疏方法通常在投影上应用均匀稀疏性,忽视 Transformer 权重统计性质的异质性,从而放大性能损失。本文提出 ActTail,一种基于 TopK 幅值的数值激活稀疏方法,其全局激活稀疏分配基于 Heavy-Tailed Self-Regularization(HT-SR)理论。具体而言,我们通过计算每个投影的经验谱密度(ESD)所得的重尾指数来捕捉这种异质性,将其作为量化指标来分配投影特定的稀疏预算。重要的是,我们提供了理论分析,建立了激活稀疏比率与重尾指数在 HT-SR 范式下的显式关系,为稀疏分配提供原则性指导,超越启发式设计。在 LLaMA 和 Mistral 模型上的实验表明,我们的方法在高稀疏性下在 perplexity 和下游任务性能方面均优于均匀分配。80% 稀疏性下,LLaMA-2-7B 的 perplexity 降低 21.8%,LLaMA-2-13B 降低 40.1%,Mistral-7B 降低 9.4%。

关键词

引用

@article{arxiv.2603.12272,
  title  = {ActTail: Global Activation Sparsity in Large Language Models},
  author = {Wenwen Hou and Xinyuan Song and Shiwei Liu},
  journal= {arXiv preprint arXiv:2603.12272},
  year   = {2026}
}