在 Cerebras 晶圆级引擎上对大型语言模型性能的基准评测
分布式、并行与集群计算
2024-09-24 v2
摘要
基于 Transformer 的大型语言模型 (LLMs) 近期在自然语言处理 (NLP) 和计算机视觉 (CV) 领域达到了最先进的性能。LLMs 利用多头自注意力 (MHSA) 机制捕捉输入词或图像块之间的长程全局注意力关系,从而大幅提升其相较于先前深度学习方法的性能。本文评估了 LLMs 在 Cerebras 晶圆级引擎 (WSE) 上的性能。Cerebras WSE 是一个高性能计算系统,拥有 2.6 万亿个晶体管、850,000 个核心和 40 GB 片上内存。Cerebras WSE 的稀疏线性代数计算 (SLAC) 核心消除了乘零操作,其 40 GB 片上内存在 SLAC 核心之间均匀分布,从而能够快速本地访问模型参数。此外,Cerebras 软件在运行时配置核心间的路由,优化了核心间的通信开销。随着 LLMs 变得越来越常用,需要新的硬件架构来加速 LLMs 的训练和推理。我们对该硬件架构在加速 LLMs 训练和推理方面的有效性进行了基准评测。此外,我们分析了 Cerebras WSE 能否利用其 20 PB/s 的高带宽内存,解决传统上受内存限制的计算任务所面临的内存墙问题。更进一步,我们通过 roofline 模型检验了 Cerebras WSE 的性能可扩展性。通过绘制性能指标与计算强度的关系图,我们旨在评估其处理高计算密集型 LLMs 训练和推理任务的有效性。
引用
@article{arxiv.2409.00287,
title = {Benchmarking the Performance of Large Language Models on the Cerebras Wafer Scale Engine},
author = {Zuoning Zhang and Dhruv Parikh and Youning Zhang and Viktor Prasanna},
journal= {arXiv preprint arXiv:2409.00287},
year = {2024}
}
备注
IEEE HPEC 2024