中文

Transformer-Lite:在手机GPU上高效部署大型语言模型

计算与语言 2024-07-08 v3

摘要

大型语言模型(LLM)被广泛用于手机上的智能助手、文本摘要、翻译和多模态等任务。然而,当前设备端LLM部署的方法推理速度慢,导致用户体验差。为了促进设备GPU上的高效LLM部署,我们提出了四种优化技术:(a)基于符号表达式的方法支持动态形状模型推理;(b)算子优化和执行优先级设置以提高推理速度并减少手机卡顿;(c)一种称为M0E4的FP4量化方法以减少反量化开销;(d)一种基于子张量的技术,消除LLM推理后复制KV缓存的需要。此外,我们在移动推理引擎Transformer-Lite中实现了这些方法,该引擎兼容高通和联发科处理器。我们使用不同架构和参数范围从2B到14B的LLM评估了Transformer-Lite的性能。具体来说,对于ChatGLM2 6B,我们实现了121 token/s的预填充速度和14 token/s的解码速度;对于较小的Gemma 2B,分别为330 token/s和30 token/s。与基于CPU的FastLLM和基于GPU的MLC-LLM相比,我们的引擎在预填充速度上实现了超过10倍的加速,在解码速度上实现了2~3倍的加速。

关键词

引用

@article{arxiv.2403.20041,
  title  = {Transformer-Lite: High-efficiency Deployment of Large Language Models on Mobile Phone GPUs},
  author = {Luchang Li and Sheng Qian and Jie Lu and Lunxi Yuan and Rui Wang and Qin Xie},
  journal= {arXiv preprint arXiv:2403.20041},
  year   = {2024}
}

备注

21 pages, 6 figures, fix "E0M4" spell mistake, fix FLOPS to TFLOPS