ReLU$^2$胜出:发现用于稀疏大语言模型的高效激活函数
机器学习
2024-02-07 v1 人工智能
摘要
稀疏计算通过动态跳过非活跃神经元的计算,为低资源场景下的大语言模型(LLM)推理提供了引人注目的解决方案。传统方法侧重于基于ReLU的LLM,利用激活值中的零值,而我们将稀疏LLM的范围扩展到零激活值之外。我们引入了一种通用方法,通过神经元输出幅度和定制的幅度阈值来定义神经元激活,证明了非ReLU的LLM也表现出稀疏激活。为了找到最适用于稀疏计算的高效激活函数,我们提出了一个系统框架,从三个方面考察LLM的稀疏性:稀疏性与性能之间的权衡、稀疏性的可预测性以及硬件亲和性。我们对使用不同激活函数(包括ReLU、SwiGLU、ReGLU和ReLU)的LLM进行了全面实验。结果表明,采用ReLU的模型在所有三个评估方面均表现出色,凸显了其作为稀疏LLM高效激活函数的潜力。我们将发布代码以促进未来研究。
引用
@article{arxiv.2402.03804,
title = {ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs},
author = {Zhengyan Zhang and Yixin Song and Guanghui Yu and Xu Han and Yankai Lin and Chaojun Xiao and Chenyang Song and Zhiyuan Liu and Zeyu Mi and Maosong Sun},
journal= {arXiv preprint arXiv:2402.03804},
year = {2024}
}