中文

面向 CPU 的大语言模型分布式推理性能优化

分布式、并行与集群计算 2024-07-02 v1

摘要

大语言模型(LLMs)拥有巨大的潜力来解决众多现实挑战,但它们通常需要巨大的计算资源和内存。将 LLMs 部署到资源受限的硬件设备上(内存容量受限) presents considerable challenges。分布式计算 作为缓解单节点内存限制并加速 LLM 推理性能的流行策略。为减轻硬件限制的负担,我们提出了一种针对 CPU 上的 LLMs 的高效分布式推理优化解决方案。我们在 5代 Intel Xeon 可扩展处理器上进行了实验,结果显示 72B 参数的 LLM 每个输出 token 所需时间为 140 毫秒/ token,远快于平均人类阅读速度约 200 毫秒/ token。

关键词

引用

@article{arxiv.2407.00029,
  title  = {Distributed Inference Performance Optimization for LLMs on CPUs},
  author = {Pujiang He and Shan Zhou and Changqing Li and Wenhuan Huang and Weifei Yu and Duyi Wang and Chen Meng and Sheng Gui},
  journal= {arXiv preprint arXiv:2407.00029},
  year   = {2024}
}

备注

4 pages, 3 figures, Practical ML for Low Resource Settings Workshop @ ICLR 2024