中文

赫梅斯:面向边缘设备的大模型内存高效流水线推理

分布式、并行与集群计算 2024-09-11 v2 人工智能 机器学习

摘要

Transformer-based 大模型的应用近年来取得了众多成功。然而,大模型参数的指数级增长为边缘端部署带来了巨大的内存挑战。目前解决此挑战的工作主要集中于优化模型结构和采用内存交换方法,但前者会降低推理准确率,后者则会增加推理延迟。本文引入 PIPELOAD,一种新型内存高效流水线执行机制,通过引入动态内存管理降低内存使用,通过采用并行模型加载最小化推理延迟。基于 PIPELOAD mechanism,我们提出了面向边缘设备的大模型推理框架——赫梅斯(Hermes)。我们在不同规模的 Transformer 模型上对 Hermes 进行评估。实验结果表明,针对 BERT 和 ViT 模型,Hermes 比当前最先进的流水线机制在推理速度上提升最高达 4.24 倍,内存消耗降低 86.7%;针对 GPT 系列模型,推理速度提升 2.58 倍,内存消耗降低 90.3%。

关键词

引用

@article{arxiv.2409.04249,
  title  = {Hermes: Memory-Efficient Pipeline Inference for Large Models on Edge Devices},
  author = {Xueyuan Han and Zinuo Cai and Yichu Zhang and Chongxin Fan and Junhan Liu and Ruhui Ma and Rajkumar Buyya},
  journal= {arXiv preprint arXiv:2409.04249},
  year   = {2024}
}

备注

Accepted by the 42nd IEEE International Conference on Computer Design (ICCD 2024)