Amphista:用于加速大语言模型推理的双向多头解码
人工智能
2024-10-21 v2 计算与语言
摘要
大语言模型(LLM)本质上使用自回归解码,这在推理中缺乏并行性,导致推理速度显著缓慢。虽然像Medusa这样的方法构建了并行化的预测头,但它们在不同预测位置之间缺乏足够的信息交互。为了克服这一限制,我们引入了Amphista,一个基于Medusa构建的增强型推测解码框架。具体来说,Amphista建模了一个能够并行推理的自动嵌入块,该块采用双向注意力机制以实现不同起草头之间的交互。此外,Amphista集成了分阶段适配层,确保了语义信息从目标模型的自回归推理到起草头的非自回归推理的无缝过渡,有效地实现了范式转换和特征融合。在Vicuna模型上使用MT-Bench和Spec-Bench进行的实验结果表明,Amphista在保持生成质量的同时实现了显著的加速。在MT-Bench上,与原始自回归解码相比,Amphista在Vicuna 33B模型上的加速比高达2.75倍,与Medusa相比加速比达1.40倍(按挂钟时间计算)。
引用
@article{arxiv.2406.13170,
title = {Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference},
author = {Zeping Li and Xinlong Yang and Ziheng Gao and Ji Liu and Guanchen Li and Zhuang Liu and Dong Li and Jinzhang Peng and Lu Tian and Emad Barsoum},
journal= {arXiv preprint arXiv:2406.13170},
year = {2024}
}