LLMCad:快速且可扩展的端侧大语言模型推理
网络与互联网体系结构
2023-09-11 v1 人工智能
摘要
生成式任务,如文本生成和问答,在移动应用领域中占据关键地位。由于其隐私敏感性,越来越需要在移动设备上直接执行。目前,这些生成式任务的执行严重依赖大语言模型(LLMs)。然而,这些设备有限的内存容量对此类模型的可扩展性提出了巨大挑战。在我们的研究中,我们引入了LLMCad,一种专为高效生成式自然语言处理(NLP)任务设计的创新型端侧推理引擎。LLMCad的核心思想围绕模型协作展开:驻留于内存中的紧凑LLM负责生成最直观的令牌,而高精度LLM介入以验证这些令牌并纠正任何已识别的错误。LLMCad融合了三项新技术:(1)LLMCad不使用顺序方式生成候选令牌,而是利用较小的LLM构建令牌树,涵盖更广的合理令牌路径;随后较大的LLM可同时高效验证所有这些路径。(2)它采用自适应回退策略,在较小LLM生成错误令牌时迅速启动验证过程。(3)为保障令牌生成的持续流动,LLMCad通过在验证过程中实现计算-IO流水线来推测式生成令牌。通过大量实验,LLMCad展现出令人印象深刻的令牌生成速度,达到比现有推理引擎快9.3倍的速率。
引用
@article{arxiv.2309.04255,
title = {LLMCad: Fast and Scalable On-device Large Language Model Inference},
author = {Daliang Xu and Wangsong Yin and Xin Jin and Ying Zhang and Shiyun Wei and Mengwei Xu and Xuanzhe Liu},
journal= {arXiv preprint arXiv:2309.04255},
year = {2023}
}