中文

稀疏化定律:迈向具有更大激活稀疏性的大语言模型

机器学习 2025-07-01 v4 计算与语言 机器学习

摘要

激活稀疏性指激活输出中存在大量弱贡献元素,这些元素可以被消除,从而使许多关注大语言模型(LLMs)的重要应用受益。尽管促进 LLM 中更大的激活稀疏性值得深入研究,但现有工作缺乏对激活稀疏性与潜在影响因素之间相关性的全面定量研究。在本文中,我们对解码器专用 Transformer 架构 LLM 中激活稀疏性的定量缩放特性和影响因素进行了全面研究。具体而言,我们提出了 PPL-p%p\% 稀疏性,一种精确且与性能感知的激活稀疏性度量,适用于任何激活函数。通过大量实验,我们发现了几个重要现象。首先,不同的激活函数表现出可比的性能但相反的训练时稀疏性趋势。激活比率(即 1稀疏率1-\text{稀疏率})随训练数据量呈收敛递增幂律和递减对数幂律变化,分别适用于 SiLU 激活和 ReLU 激活的 LLM。这表明 ReLU 作为激活函数比 SiLU 更高效,可以利用更多训练数据来改善激活稀疏性。其次,在低于某个瓶颈点以下,激活比率随宽度-深度比线性增加,表明在固定参数规模下更深架构的潜在优势。最后,在相似的宽度-深度比下,我们惊人地发现激活稀疏性的极限值随参数规模弱变化,即 LLM 中的激活模式对参数规模不敏感。这些迈向具有更大激活稀疏性 LLM 的经验法则对于使 LLM 更高效和更具可解释性具有重要启示。

关键词

引用

@article{arxiv.2411.02335,
  title  = {Sparsing Law: Towards Large Language Models with Greater Activation Sparsity},
  author = {Yuqi Luo and Chenyang Song and Xu Han and Yingfa Chen and Chaojun Xiao and Xiaojun Meng and Liqun Deng and Jiansheng Wei and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2411.02335},
  year   = {2025}
}

备注

23 pages, 13 figures, 6 tables