基于分批与量化的大型语言模型推理边缘智能优化
机器学习
2024-05-14 v1 人工智能
网络与互联网体系结构
摘要
生成式人工智能(GAI)凭借其非凡的内容创造能力正掀起热潮,大型语言模型(LLM)是推动这一运动的前沿力量。然而,LLM 的显著资源需求常需依赖云端托管,进而引发隐私、延迟和使用限制等问题。尽管边缘智能长期用于通过在靠近数据源的通用边缘资源上实现实时 AI 计算以解决这些挑战,但大多数研究聚焦于传统 AI 模型,尚未充分解决 LLM 推理的独特特征,如模型规模庞大、自回归过程以及自注意力机制。本文提出针对 LLM 推理的边缘智能优化问题。具体而言,在资源受限的边缘设备上部署分批技术和模型量化,我们构建基于 transformer 解码器的 LLM 推理模型。进一步地,我们的目标是通过 batch 调度和通信-计算资源的联合分配,在考虑边缘资源约束以及用户对延迟和准确率的不同要求的前提下,最大化推理吞吐量。为克服该 NP 难问题,我们开发了一种在可行时间复杂度内运行的 optimal Depth-First Tree-Searching algorithm with online tree-Pruning(DFTSP)。仿真结果表明,DFTSP 在多样化用户设置和量化技术下均超越其他分批基准实现更高吞吐量,并相较于暴力搜索方法将时间复杂性降低超过45%。
引用
@article{arxiv.2405.07140,
title = {Edge Intelligence Optimization for Large Language Model Inference with Batching and Quantization},
author = {Xinyuan Zhang and Jiang Liu and Zehui Xiong and Yudong Huang and Gaochang Xie and Ran Zhang},
journal= {arXiv preprint arXiv:2405.07140},
year = {2024}
}