Transformer-Lite:在手机GPU上高效部署大型语言模型
计算与语言
2024-07-08 v3
摘要
大型语言模型(LLM)被广泛用于手机上的智能助手、文本摘要、翻译和多模态等任务。然而,当前设备端LLM部署的方法推理速度慢,导致用户体验差。为了促进设备GPU上的高效LLM部署,我们提出了四种优化技术:(a)基于符号表达式的方法支持动态形状模型推理;(b)算子优化和执行优先级设置以提高推理速度并减少手机卡顿;(c)一种称为M0E4的FP4量化方法以减少反量化开销;(d)一种基于子张量的技术,消除LLM推理后复制KV缓存的需要。此外,我们在移动推理引擎Transformer-Lite中实现了这些方法,该引擎兼容高通和联发科处理器。我们使用不同架构和参数范围从2B到14B的LLM评估了Transformer-Lite的性能。具体来说,对于ChatGLM2 6B,我们实现了121 token/s的预填充速度和14 token/s的解码速度;对于较小的Gemma 2B,分别为330 token/s和30 token/s。与基于CPU的FastLLM和基于GPU的MLC-LLM相比,我们的引擎在预填充速度上实现了超过10倍的加速,在解码速度上实现了2~3倍的加速。
引用
@article{arxiv.2403.20041,
title = {Transformer-Lite: High-efficiency Deployment of Large Language Models on Mobile Phone GPUs},
author = {Luchang Li and Sheng Qian and Jie Lu and Lunxi Yuan and Rui Wang and Qin Xie},
journal= {arXiv preprint arXiv:2403.20041},
year = {2024}
}
备注
21 pages, 6 figures, fix "E0M4" spell mistake, fix FLOPS to TFLOPS