中文

LLM 推理期间并非所有层都是必要的

计算与语言 2024-07-10 v3 人工智能 机器学习

摘要

由于参数量巨大,大语言模型(LLM)的推理阶段资源消耗密集。然而,并非所有向 LLM 提出的请求都同样难以处理。通过分析,我们表明对于某些任务,LLM 能够在某些中间层产生与最终输出相当的结果。也就是说,LLM 推理期间并非所有层都是必要的。如果我们能够预测在哪一层推理结果与最终结果(通过评估所有层产生)相匹配,我们就可以显著降低推理成本。为此,我们提出了一种简单而有效的算法,名为 AdaInfer,以自适应地终止输入实例的推理过程。AdaInfer 依赖于易于获取的统计特征和诸如 SVM 的经典分类器。在 Llama2 系列和 OPT 等知名 LLM 上的实验表明,AdaInfer 能够实现平均 17.8% 的剪枝率,在情感任务上最高可达 43%,且几乎没有性能下降(<1%)。由于 AdaInfer 不改变 LLM 参数,集成了 AdaInfer 的 LLM 保持了跨任务的泛化能力。

关键词

引用

@article{arxiv.2403.02181,
  title  = {Not All Layers of LLMs Are Necessary During Inference},
  author = {Siqi Fan and Xin Jiang and Xiang Li and Xuying Meng and Peng Han and Shuo Shang and Aixin Sun and Yequan Wang and Zhongyuan Wang},
  journal= {arXiv preprint arXiv:2403.02181},
  year   = {2024}
}