中文

CopySpec:一种无需牺牲质量的大语言模型推测复制粘贴加速技术

计算与语言 2025-05-26 v2 人工智能 机器学习

摘要

我们介绍 CopySpec,这是一种简单且有效的技术,用于解决大语言模型在生成与先前输出高度相似的响应或可从上下文中逐字提取的响应时所面临的效率问题。CopySpec 通过识别模型聊天历史或上下文中的重复序列,并推测相同标记将跟随,从而实现无需牺牲输出质量、无需额外 GPU 内存的无缝复制。为评估我们方法的有效性,我们使用七个大语言模型和五个数据集进行了实验:MT-Bench、CNN/DM、GSM8K、HumanEval 以及我们新创建的数据集 MT-Redundant。MT-Redundant 数据集将 MT-Bench 的第二轮转化为对第一轮答案变体的请求,模拟用户请求修改先前响应的真实场景。我们的结果显示显著的加速:CNN/DM 上达 2.35 倍,MT-Redundant 特定类别第二轮达 3.08 倍,GSM8K 自我纠正任务第三轮达 2.66 倍。重要的是,我们展示 CopySpec 可无缝集成到推测解码中,对于 MT-Redundant 所有八个类别的第二轮,平均额外加速 49%。尽管大语言模型即使配合推测解码也随上下文大小增大而推理变慢,但 CopySpec 利用更大的上下文加速推理,成为一种更快的互补解决方案。我们的代码和数据集已公开于 https://github.com/RazvanDu/CopySpec。

关键词

引用

@article{arxiv.2502.08923,
  title  = {CopySpec: Accelerating LLMs with Speculative Copy-and-Paste Without Compromising Quality},
  author = {Razvan-Gabriel Dumitru and Minglai Yang and Vikas Yadav and Mihai Surdeanu},
  journal= {arXiv preprint arXiv:2502.08923},
  year   = {2025}
}

备注

33 pages, 18 figures, 19 tables