通过标记循环将垃圾变为宝藏:加速大型语言模型推理
计算与语言
2025-05-27 v3 机器学习
摘要
大型语言模型(LLM)的大量参数使得推理延迟成为根本性瓶颈。拟合解码代表一种无损加速推理的方法,采用猜测-验证范式。某些方法依赖额外的架构来猜测草稿标记,这需要额外的训练。或者,基于检索的训练-free 技术从既有语料库或 n-gram 生成中构建库,但面临存储需求大、检索耗时且适应性有限的挑战。观察到在解码过程中生成的候选标记很可能在未来序列中再次出现,我们提出了标记循环(Token Recycling)。它将候选标记存储在邻接矩阵中,并采用类似广度优先搜索(BFS)的算法构建草稿树,通过树注意力进行验证。随后,新的候选标记用于更新矩阵。标记循环仅需不足 2MB 的额外存储空间,并在所有规模的 LLM 上实现约 2 倍的加速。它在现有训练-free 方法中显著优于 30%,甚至在广为人知的训练方法中也优于 25%。
引用
@article{arxiv.2408.08696,
title = {Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling},
author = {Xianzhen Luo and Yixuan Wang and Qingfu Zhu and Zhiming Zhang and Xuanyu Zhang and Qing Yang and Dongliang Xu},
journal= {arXiv preprint arXiv:2408.08696},
year = {2025}
}
备注
Accepted by ACL2025. Code is [here](https://github.com/Luowaterbi/TokenRecycling). Token Recycling has already merged into [SpecBench](https://github.com/hemingkx/Spec-Bench)