基于 Habana Gaudi 处理器的大语言模型基准测试与深入性能研究
机器学习
2023-10-02 v1 分布式、并行与集群计算
摘要
Transformer 模型在各种机器学习任务中取得了显著成功,但面临高计算复杂度和资源需求。自注意力机制的二次复杂度在处理长序列与大数据集时进一步加剧了这些挑战。专用 AI 硬件加速器,如 Habana GAUDI 架构,为解决这些问题提供了有前景的方案。GAUDI 具备矩阵乘法引擎(MME)与一组完全可编程的张量处理核(TPC)。本文探索了使用 GAUDI 处理器加速基于 Transformer 的模型的未开发潜力,并解决过程中的关键挑战。首先,我们提供了 MME 与 TPC 组件间的综合性能比较,阐明其相对优势与不足。其次,我们探索优化 MME 与 TPC 利用率的策略,提供提升计算效率的实用见解。第三,我们评估了 Transformer 在 GAUDI 上的性能,特别是在处理长序列与揭示性能瓶颈方面。最后,我们评估了两种基于 Transformer 的大语言模型(LLM)在 GAUDI 上的端到端性能。本工作的贡献包括为从业者和研究者提供实用见解。我们通过系统化的性能剖析、分析与优化探索深入研究了 GAUDI 对 Transformer 的支撑能力。我们的研究弥补了研究空白,并为在 GAUDI 架构上优化基于 Transformer 的模型训练提供了路线图。
引用
@article{arxiv.2309.16976,
title = {Benchmarking and In-depth Performance Study of Large Language Models on Habana Gaudi Processors},
author = {Chengming Zhang and Baixi Sun and Xiaodong Yu and Zhen Xie and Weijian Zheng and Kamil Iskra and Pete Beckman and Dingwen Tao},
journal= {arXiv preprint arXiv:2309.16976},
year = {2023}
}