CoreInfer:基于语义感知自适应稀疏激活加速大语言模型推理
机器学习
2024-10-25 v1 计算与语言
摘要
拥有数十亿参数的大语言模型(LLM)引发了新的 AI 应用浪潮,但其在推理阶段的高计算成本和内存需求构成了重大挑战。仅为每个 token 激活少数神经元的自适应稀疏激活推理,为在不牺牲性能的情况下加速模型推理提供了潜力,特别适用于资源受限的硬件设备。然而,现有方法基于单个 token 预测激活神经元,需额外的 MLP,导致激活图频繁变更和资源调度,限制了稀疏激活的加速效益。本文引入 CoreInfer,一种基于句子级预测的无 MLP 自适应稀疏激活推理方法。具体地,我们提出句子级核心神经元的概念,即针对给定句子最关键的神经元子集,并经验性地证明其有效性。为确定核心神经元,我们探索了核心神经元与句子语义之间的相关性。惊人的是,核心神经元相对于句子语义表现出稳定性和相似性——这一洞察被前人研究所忽略。基于此发现,我们进一步设计两种语义驱动的方法用于预测核心神经元,以适应不同输入场景。在 CoreInfer 中,核心神经元在填充阶段确定,编码阶段固定,从而实现零成本稀疏推理。我们在各种模型和任务上评估了 CoreInfer 的模型泛化性和任务泛化性。值得注意的是,在 NVIDIA TITAN XP GPU 上,CoreInfer 相较于 Huggingface 实现和 PowerInfer 分别实现了 10.33 倍和 2.72 倍的加速。
引用
@article{arxiv.2410.18311,
title = {CoreInfer: Accelerating Large Language Model Inference with Semantics-Inspired Adaptive Sparse Activation},
author = {Qinsi Wang and Saeed Vahidian and Hancheng Ye and Jianyang Gu and Jianyi Zhang and Yiran Chen},
journal= {arXiv preprint arXiv:2410.18311},
year = {2024}
}
备注
Project page: https://wangqinsi1.github.io/coreinfer_page/