WINA:面向大语言模型推理加速的权重感知神经元激活
机器学习
2026-02-19 v2 人工智能
摘要
大语言模型(LLM)不断增长的算力需求使得高效推理与激活策略日益关键。尽管诸如混合专家(Mixture-of-Experts, MoE)等近期方法利用了选择性激活,但需要专门的训练;而无训练稀疏激活方法凭借其即插即用的设计,提供了更广泛的适用性与更优的资源效率。然而,许多现有方法仅依赖隐藏状态的幅值来决定激活,导致较高的近似误差和次优的推理准确率。为解决这些局限性,我们提出了 WINA(Weight Informed Neuron Activation,权重感知神经元激活),一种新颖、简单且无需训练的稀疏激活框架,该框架联合考虑隐藏状态幅值与权重矩阵的逐列 -范数。我们证明这导出了一种稀疏化策略,能够获得最优的近似误差界限,其理论保证比现有技术更为紧致。在实验中,WINA 在相同的稀疏度水平下,在多种 LLM 架构和数据集上的平均性能比 SOTA 方法(如 TEAL)高出达 。这些结果确立了 WINA 作为 LLM 推理中无训练稀疏激活的新性能前沿,推进了无训练稀疏激活方法,并为高效推理设定了稳健的基线。源代码可在 https://github.com/microsoft/wina 获取。
引用
@article{arxiv.2505.19427,
title = {WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference},
author = {Sihan Chen and Dan Zhao and Jongwoo Ko and Colby Banbury and Huiping Zhuang and Luming Liang and Pashmina Cameron and Tianyi Chen},
journal= {arXiv preprint arXiv:2505.19427},
year = {2026}
}