ISO:大语言模型推理中序列内的计算与通信重叠
分布式、并行与集群计算
2024-09-18 v1 计算与语言
机器学习
性能
摘要
在大语言模型(LLM)推理领域,Transformer 模型的内在结构以及多 GPU 张量并行策略导致了计算和通信的串行执行。这导致在通信阶段计算资源的大量闲置。为了缓解这一问题,人们开发了各种技术来优化通信过程中的计算能力利用。这些策略主要涉及重叠矩阵计算和通信,以及在不同请求之间交错微批次。然而,这些方法要么无法实现理想的重叠,要么对其应用施加了某些限制。为了克服这些挑战,本文提出了一种在序列级别上运行的计算-通信重叠的新策略。该方法不仅增强了重叠程度,还最小化了对其适用性的限制。使用 30b/70b 模型进行的实验评估表明,效率得到了显著提高。具体来说,所提出的技术已被证明在 4090 GPU 上的预填充阶段将时间消耗减少了约 35%,在 A800 GPU 上减少了约 15%。
引用
@article{arxiv.2409.11155,
title = {ISO: Overlap of Computation and Communication within Seqenence For LLM Inference},
author = {Bin Xiao and Lei Su},
journal= {arXiv preprint arXiv:2409.11155},
year = {2024}
}