BASS: 批量注意力优化的推测采样
计算与语言
2024-05-30 v4
摘要
推测解码已成为提高大型语言模型延迟和吞吐量的强大方法。然而,大多数现有实现 focuses on 为单个序列生成。实际生成式 AI 应用程序通常需要多个响应,而在保持其延迟优势的同时进行批量推测解码则面临诱人的挑战。这篇论文描述了一个批量推测解码系统,在多序列生成延迟和 GPU 利用率方面均达到了新的业界最佳水平。例如,对于一个 7.8B 参数的模型,单张 A100 GPU 上 batch size 为 8 时,每个序列平均每 token 生成 5.8ms,总体吞吐量达 1.1K token/s。这些结果代表了业界最佳的延迟和常规解码的 2.15 倍速度提升。在常规解码无法完成的时限内,我们的系统能够生成 HumanEval Pass@First 为 43%、Pass@All 为 61%的序列,远超单序列推测解码的可行性。在解码期间,我们的峰值 GPU 利用率可达 15.8%,是常规解码的最高值的 3 倍以上,也是单序列推测解码的最高值的约 10 倍。
引用
@article{arxiv.2404.15777,
title = {A Comprehensive Survey on Evaluating Large Language Model Applications in the Medical Industry},
author = {Yining Huang and Keke Tang and Meilian Chen and Boyuan Wang},
journal= {arXiv preprint arXiv:2404.15777},
year = {2024}
}
备注
42 pages, 1 figure