超越投机游戏:大型语言模型中投机执行的综述
计算与语言
2024-04-24 v1 人工智能
摘要
随着(因果)大型语言模型(LLM)规模的不断增大,推理效率成为提升性能效果中的核心关注点之一。相较于内存占用,延迟瓶颈似乎更为重要,因为某些大型语言模型(如 GPT-4)每天可能需要处理数十亿条请求。这种瓶颈主要源于语言模型的自回归特性,即在解码过程中只能顺序生成标记。为缓解此瓶颈,一种源自计算机体系结构领域的投机执行(speculative execution)思想被引入到大型语言模型的解码中,采用“草拟-验证”(draft-then-verify)的方式。在此模式下,一系列标记将以某种启发式方法快速草拟,然后由语言模型并行验证这些标记。通过将昂贵的顺序推理并行化,可以显著提升大型语言模型的解码速度。鉴于大型语言模型在过去几年内的成功,针对该方向的文献数量正在快速增长。然而,目前缺乏一篇定位性综述来总结该领域的当前格局,并为未来发展绘制路线图。为满足这一需求,我们提出了第一篇综述性论文,全面审阅和统一梳理了大型语言模型中投机执行文献(如块状并行解码、投机解码等),并以系统化的框架和分类体系进行组织。基于该分类体系,我们对当前研究进行了批判性综述和比较分析。最后,我们指出了该领域的各种关键挑战和未来发展方向,以进一步推动该领域的发展。
引用
@article{arxiv.2404.14897,
title = {Beyond the Speculative Game: A Survey of Speculative Execution in Large Language Models},
author = {Chen Zhang and Zhuorui Liu and Dawei Song},
journal= {arXiv preprint arXiv:2404.14897},
year = {2024}
}
备注
10 pages, 4 figures, 1 table, rejected from IJCAI 2024, revision in progress