中文

内存才是关键:加速大型语言模型推理的计算-存储架构概览

硬件体系结构 2024-06-13 v1 机器学习

摘要

大型语言模型(LLMs)最近在自然语言处理领域取得了显著进展,使机器能够生成类人文本并进行有意义的对话。这种发展 necessitates 速度、效率和可及性在 LLM 推理方面,因为这些系统的计算和存储要求呈指数级增长。与此同时,计算和存储能力的进步未能跟上,尤其是受Moore's law停滞的影响。当LLMs超过单个GPU的容量时,它们需要复杂的、专家级的配置来进行并行处理。内存访问的成本显著高于计算,导致高效扩展的挑战,称为内存墙。这里,计算-存储(CIM)技术为加速AI推理提供了有前景的解决方案,通过在存储中直接执行模拟计算,可能降低延迟和功耗。通过将存储和计算元素紧密集成,CIM消除了von Neumann瓶颈,减少数据传输并提高能源效率。本篇调查论文提供了基于Transformer的模型概览,审查各种CIM架构,并探讨它们如何解决现代AI计算系统的即将到来的挑战。我们讨论了与Transformer相关的算子及其硬件加速方案,并强调了相应CIM设计中的挑战、趋势和见解。

关键词

引用

@article{arxiv.2406.08413,
  title  = {Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference},
  author = {Christopher Wolters and Xiaoxuan Yang and Ulf Schlichtmann and Toyotaro Suzumura},
  journal= {arXiv preprint arXiv:2406.08413},
  year   = {2024}
}