中文

SparseInfer:面向快速 LLM 推理的免训练激活稀疏性预测

性能 2025-01-27 v2

摘要

利用稀疏性对于优化大语言模型推理至关重要。然而,采用 SiLU 作为激活函数的现代 LLM 表现出极小的激活稀疏性。近期研究提出用 ReLU 替代 SiLU 以诱导显著的激活稀疏性,并表明通过微调不会降低下游任务的准确率。然而,要充分利用这一点,需要训练一个预测器来估计这种稀疏性。本文引入了 SparseInfer,一种简单、轻量且免训练的 ReLU 域 LLM 激活稀疏性预测器,它仅通过比较输入和权重的符号位来预测激活稀疏性。为了弥补可能的预测不准确,该预测器支持对其保守性进行自适应调整,这也可作为优化 LLM 推理的控制旋钮。所提方法实现了优于 SOTA 的推理速度,且准确率损失可忽略不计(小于 1%)。

关键词

引用

@article{arxiv.2411.12692,
  title  = {SparseInfer: Training-free Prediction of Activation Sparsity for Fast LLM Inference},
  author = {Jiho Shin and Hoeseok Yang and Youngmin Yi},
  journal= {arXiv preprint arXiv:2411.12692},
  year   = {2025}
}

备注

7 pages, 4 figures