中文

ME-Switch:面向大语言模型的内存高效专家切换框架

计算与语言 2024-10-29 v2 人工智能 机器学习

摘要

LLM 开发涉及在大规模数据上对基础模型进行预训练,然后针对特定任务的数据进行微调,以创建专业的专家。为这些专家提供服务会提出重大的内存挑战,因为将所有专家加载到设备上是不可行的,频繁地响应用户请求在专家之间切换会造成相当大的 I/O 成本。以前的方法将专家权重分解为预训练权重加上 delta 权重,然后通过使用输出通道级步长进行量化来压缩 delta 权重,从而减小模型大小。然而,这些方法忽略了某些 delta 权重的输入通道在极低位宽下会导致显著的量化误差。此外,现有方法假设针对用户请求的合适模型是提前已知的,这在实际中并非如此。为此,我们引入 ME-Switch,一个针对服务多个 LLM 的内存高效专家切换框架。为了缩减描述 delta 权重所需的位数,我们提出一种以显著性感知为导向的 delta 压缩方法,通过基于重建误差识别显著输入通道并应用混合精度量化,从而将非显著通道压缩至低位,同时保留显著通道,从而在不损失性能的前提下降低存储需求。此外,我们开发了一种模型级路由方法,通过执行领域分类高效地将用户查询引导至最合适的专家。大量实验表明,ME-Switch 在内存效率和路由性能方面均显示出良好的前景。例如,在为三款来自 Mistral-7B 系列的模型提供服务时,ME-Switch 可将模型大小降低 1.74×1.74\times,并在指令、数学推理和代码生成任务上保持近乎无损的性能。值得注意的是,我们的方法能够在单个 NVIDIA A100 GPU 上高效地服务 16 个 Mistral-7B 模型。

关键词

引用

@article{arxiv.2406.09041,
  title  = {ME-Switch: A Memory-Efficient Expert Switching Framework for Large Language Models},
  author = {Jing Liu and Ruihao Gong and Mingyang Zhang and Yefei He and Jianfei Cai and Bohan Zhuang},
  journal= {arXiv preprint arXiv:2406.09041},
  year   = {2024}
}

备注

Tech report