SambaNova SN40L:通过数据流和专家组合扩展 AI 内存墙
摘要
巨型语言模型 (LLM) 如 GPT-4 已为现代生成式 AI 应用铺平了道路。然而,以巨型 LLM 为规模进行训练、部署和维护仍然昂贵且具有挑战性。现代 AI 加速器的计算-存储比例的不平衡增加创建了内存墙,亟需新的方法进行 AI 部署。组合专家 (CoE) 作为一种模块化方法,降低了训练和部署的成本和复杂度。然而,使用常规硬件时,这种方法存在两个关键挑战:(1) 在未进行融合操作的情况下,较小模型的运算强度较低,这使得实现高利用率更具挑战性;(2) 在动态切换大量模型时,既可能昂贵又可能缓慢。本文描述了如何将 CoE、流式数据流和三级存储系统一起扩展 AI 内存墙。我们描述了 Samba-CoE,这是一个拥有 150 个专家、总参数为千亿的 CoE 系统。我们将 Samba-CoE 部署在 SambaNova SN40L 可重构数据流单元 (RDU) 上——这是一种为企业推断和训练应用共设计的商业数据流加速器架构。该芯片引入了新的三级存储系统,包括 on-chip 分布式 SRAM、on-package HBM 和 off-package DDR DRAM。专用的 inter-RDU 网络 enables 在多个插槽上进行 scale up and out。我们在运行于八个 RDU 插槽上的各种基准测试中,相对于未融合的基线实现了 2 倍至 13 倍的加速。我们表明,对于 CoE 推断部署,8 插槽 RDU 节点将机器占地缩小了最高可达 19 倍,将模型切换时间加快 15 倍至 31 倍,并在 DGX H100 和 DGX A100 上实现整体加速分别为 3.7 倍和 6.6 倍。
引用
@article{arxiv.2405.07518,
title = {SambaNova SN40L: Scaling the AI Memory Wall with Dataflow and Composition of Experts},
author = {Raghu Prabhakar and Ram Sivaramakrishnan and Darshan Gandhi and Yun Du and Mingran Wang and Xiangyu Song and Kejie Zhang and Tianren Gao and Angela Wang and Karen Li and Yongning Sheng and Joshua Brot and Denis Sokolov and Apurv Vivek and Calvin Leung and Arjun Sabnis and Jiayu Bai and Tuowen Zhao and Mark Gottscho and David Jackson and Mark Luttrell and Manish K. Shah and Edison Chen and Kaizhao Liang and Swayambhoo Jain and Urmish Thakker and Dawei Huang and Sumti Jairath and Kevin J. Brown and Kunle Olukotun},
journal= {arXiv preprint arXiv:2405.07518},
year = {2024}
}
备注
2024 57th IEEE/ACM International Symposium on Microarchitecture (MICRO)