中文

CQIL:基于准独立层并发计算的推理延迟优化

计算与语言 2024-07-08 v2

摘要

快速增长的大规模语言模型在几乎所有自然语言处理任务上都展现出前所未有的性能。然而,大语言模型的有效性依赖于指数级增长的参数量。庞大的计算复杂度导致了高推理延迟,对用户体验产生负面影响。现有的提高推理效率的方法,如张量并行和量化,旨在降低每层计算延迟,却忽略了层数带来的累积延迟。最近关于通过移除层来减少累积延迟的工作则导致了显著的性能下降。受相邻层之间输入相似性的启发,我们提出识别准独立层,这些层可以并发计算以显著降低推理延迟。我们还引入了一种旁路技术来减轻信息丢失的影响。在 LLaMA 模型上对所提出方法的实证实验证实,准独立层并发计算(CQIL)可以在 LLaMA-33B 上将延迟降低高达 48.3%,同时保持相近的性能水平。

关键词

引用

@article{arxiv.2404.06709,
  title  = {CQIL: Inference Latency Optimization with Concurrent Computation of Quasi-Independent Layers},
  author = {Longwei Zou and Qingyang Wang and Han Zhao and Jiangang Kong and Yi Yang and Yangdong Deng},
  journal= {arXiv preprint arXiv:2404.06709},
  year   = {2024}
}

备注

ACL 2024