中文

R-Sparse:面向高效 LLM 推理的基于秩信息的激活稀疏

机器学习 2025-04-29 v1

摘要

大型语言模型(LLM)虽然在 various 应用中展现出惊人的能力,但在推理过程中因模型规模巨大而面临重大挑战,尤其是在边缘设备上部署时更为突出。激活稀疏技术为降低计算和内存移动,提供了在小批量设备上实现高效推理的前景。然而,现有方法要么无法处理构成大多数前沿 LLM 激活函数的非 ReLU 函数,要么需要大量持续训练。此外,难以预测活跃通道以及可实现的稀疏比例有限,限制了激活稀疏方法的有效性。本文介绍了 R-Sparse,这是一种无需训练即可在前沿 LLM 中实现高稀疏率的激活稀疏方法。我们对单个线性层中各组成部分对输出的贡献进行了两项初步调查,发现两个关键观察:(i) 非稀疏输入函数的组成部分可视为少数偏置项,(ii) 完整计算可通过合理组合输入通道与权重奇异值来有效近似。基于此,我们将 LLM 中的线性层替换为一种基于输入通道稀疏性和奇异值分量的秩感知稀疏推理方法,无需像输出稀疏方法那样预测活跃通道。在 Llama-2/3 和 Mistral 模型上的十个多样化任务实验表明,R-Sparse 在实现 50% 模型级稀疏率的同时,性能与基线相当,实现了约 43% 的端到端效率提升,并通过定制化内核实现。

关键词

引用

@article{arxiv.2504.19449,
  title  = {R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference},
  author = {Zhenyu Zhang and Zechun Liu and Yuandong Tian and Harshit Khaitan and Zhangyang Wang and Steven Li},
  journal= {arXiv preprint arXiv:2504.19449},
  year   = {2025}
}

备注

ICLR 2025