中文

Clover:集成顺序知识的轻量级回归式推测解码

计算与语言 2024-05-02 v1 人工智能 机器学习

摘要

大型语言模型 (LLM) 因与大多数当代GPU设计的自回归解码需求之间的不匹配而效率低下。具体而言,必须通过其有限的内存带宽将数十亿到数万亿参数加载到GPU缓存中进行计算,但实际计算的 only a small batch of tokens。因此,GPU大部分时间都在进行内存传输而不是计算。最近,平行解码(一种类型的推测解码算法)变得更加流行,并在生成中展现了显著的效率改进。它引入额外的解码头到大型模型中,使其能够一次性预测多个后续标记并在单个解码步骤中验证这些候选延续。然而,这种方法偏离了预训练期间用于下一个标记预测的训练目标,导致候选标记的命中率较低。本文提出了一种新的推测解码算法Clover,将顺序知识集成到平行解码过程中。这种增强提高了speculator的命中率,从而提高了整体效率。Clover通过Regressive Connection传输预推测标记的顺序知识,然后使用Attention Decoder来整合这些推测标记。此外,Clover包含一个Augmenting Block,用于修改隐藏状态以更好地符合推测生成的目的而非下一个标记预测。实验结果表明,Clover在Baichuan-Small上比基线高出最多91%,在Baichuan-Large上高出最多146%,并且在Baichuan-Small上超过了之前最高性能的方法Medusa高出最多37%,在Baichuan-Large上高出最多57%。

关键词

引用

@article{arxiv.2405.00263,
  title  = {Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge},
  author = {Bin Xiao and Chunan Shi and Xiaonan Nie and Fan Yang and Xiangwei Deng and Lei Su and Weipeng Chen and Bin Cui},
  journal= {arXiv preprint arXiv:2405.00263},
  year   = {2024}
}