中文

ReLU$^2$胜出:发现用于稀疏大语言模型的高效激活函数

机器学习 2024-02-07 v1 人工智能

摘要

稀疏计算通过动态跳过非活跃神经元的计算,为低资源场景下的大语言模型(LLM)推理提供了引人注目的解决方案。传统方法侧重于基于ReLU的LLM,利用激活值中的零值,而我们将稀疏LLM的范围扩展到零激活值之外。我们引入了一种通用方法,通过神经元输出幅度和定制的幅度阈值来定义神经元激活,证明了非ReLU的LLM也表现出稀疏激活。为了找到最适用于稀疏计算的高效激活函数,我们提出了一个系统框架,从三个方面考察LLM的稀疏性:稀疏性与性能之间的权衡、稀疏性的可预测性以及硬件亲和性。我们对使用不同激活函数(包括ReLU、SwiGLU、ReGLU和ReLU2^2)的LLM进行了全面实验。结果表明,采用ReLU2^2的模型在所有三个评估方面均表现出色,凸显了其作为稀疏LLM高效激活函数的潜力。我们将发布代码以促进未来研究。

关键词

引用

@article{arxiv.2402.03804,
  title  = {ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs},
  author = {Zhengyan Zhang and Yixin Song and Guanghui Yu and Xu Han and Yankai Lin and Chaojun Xiao and Chenyang Song and Zhiyuan Liu and Zeyu Mi and Maosong Sun},
  journal= {arXiv preprint arXiv:2402.03804},
  year   = {2024}
}