EAGLE-3:通过训练时间测试放大大语言模型推理加速
计算与语言
2025-04-24 v3
摘要
现代大语言模型的顺序性质使得其昂贵且缓慢,已证明拟合采样是解决此问题的有效方法。诸如 EAGLE 等方法在特征层面进行自回归,通过重用目标模型的顶层特征来实现优于 vanilla 拟合采样的效果。LLM 社区的一个趋势是通过扩大训练数据来提升模型智能,而不增加推理成本。然而,我们观察到扩大数据为 EAGLE 提供的改进有限。我们识别出这一限制源于 EAGLE 的特征预测约束。本文介绍 EAGLE-3,放弃特征预测,转而进行直接 token 预测,并通过一种称为 training-time test 的技术将对顶层特征的依赖替换为多层特征融合。这些改进显著提升了性能,使草稿模型能够充分受益于扩大训练数据的优势。我们的实验包括聊天模型和推理模型,在五个任务上进行评估。结果表明,EAGLE-3 的加速比最高可达 6.5 倍,相较于 EAGLE-2 约提升 1.4 倍。在 SGLang 框架中,EAGLE-3 在 batch size 为 64 时实现 1.38 倍的吞吐量提升。代码已公开于 https://github.com/SafeAILab/EAGLE。
引用
@article{arxiv.2503.01840,
title = {EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test},
author = {Yuhui Li and Fangyun Wei and Chao Zhang and Hongyang Zhang},
journal= {arXiv preprint arXiv:2503.01840},
year = {2025}
}