中文

现代大型语言模型中激活稀疏性的普遍性质

机器学习 2026-02-19 v2

摘要

激活稀疏性是深层神经网络的有趣属性,因其在效率、鲁棒性和可解释性方面的优势而在 ReLU 类模型中受到广泛研究。但依赖精确零激活的方法无法直接应用于现代大型语言模型 (LLMs),导致 LLM 激活稀疏性研究呈碎片化、模型特定策略,并存在其一般性理解的鸿沟。在本 work 中,我们引入一种用于评估当代 LLMs 稀疏性鲁棒性的通用框架,并系统性地研究了该现象在其前馈 (FFN) 层中的表现。我们的结果揭示了跨 diverse model family 和规模的激活稀疏性的普遍性质。重要的是,我们观察到有效激活稀疏性的潜力随模型规模增长,凸显其随模型扩缩而增长的相关性。此外,我们首次研究了基于扩散的 LLMs 中的激活稀疏性。总体而言,我们的 work 提供了全面视角和实际指导,旨在利用激活稀疏性进行 LLM 设计和加速。

关键词

引用

@article{arxiv.2509.00454,
  title  = {Universal Properties of Activation Sparsity in Modern Large Language Models},
  author = {Filip Szatkowski and Patryk Będkowski and Alessio Devoto and Jan Dubiński and Pasquale Minervini and Mikołaj Piórczyński and Simone Scardapane and Bartosz Wójcik},
  journal= {arXiv preprint arXiv:2509.00454},
  year   = {2026}
}

备注

ICLR 2026, main track