中文

FIRP:通过未来中间表示预测加速 LLM 推理

计算与语言 2024-10-29 v1

摘要

大型语言模型(LLM)的最新进展在广泛任务中展现出卓越性能。尽管如此,LLM 解码的自回归特性每次前向传播仅生成单个 token,未能充分利用 GPU 的并行计算能力,导致显著延迟。为了解决这一问题,我们引入了一种名为 FIRP 的新型推测解码方法,它在每个解码步骤生成多个 token 而非一个。我们通过预测未来 token(尚未解码的 token)的中间隐藏状态,然后使用这些伪隐藏状态来解码未来 token,从而实现这一点;具体而言,这些伪隐藏状态是通过 LLM 中间层的简单线性变换预测得到的。一旦被预测,它们便参与所有后续层的计算,从而吸收更丰富的语义信息。随着层加深,伪隐藏状态与真实隐藏状态之间的语义差距缩小,使得高精度解码未来 token 成为可能。为了验证 FIRP 的有效性,我们进行了大量实验,结果表明在多个模型和数据集上实现了 1.9 倍至 3 倍的加速比,分析实验也证明了我们的动机。

关键词

引用

@article{arxiv.2410.20488,
  title  = {FIRP: Faster LLM inference via future intermediate representation prediction},
  author = {Pengfei Wu and Jiahao Liu and Zhuocheng Gong and Qifan Wang and Jinpeng Li and Jingang Wang and Xunliang Cai and Dongyan Zhao},
  journal= {arXiv preprint arXiv:2410.20488},
  year   = {2024}
}