Samoyeds:利用稀疏张量核心加速带结构稀疏性的MoE模型
机器学习
2025-03-17 v1 人工智能
分布式、并行与集群计算
操作系统
摘要
混合专家(MoE)基于的大型语言模型(LLM)的规模不断扩大,带来了显著的计算和内存挑战,迫切需要创新解决方案以在不牺牲模型准确性的前提下提高效率。结构化稀疏性作为一种有力的策略,可通过利用新兴的稀疏计算硬件来实现这一目标。以往的工作主要关注模型参数中的稀疏性,忽略了激活中固有的稀疏模式。这种疏漏可能导致与激活相关的额外计算成本,可能导致性能次优。本文提出了Samoyeds,一种用于MoE LLMs的创新加速系统,利用稀疏张量核心(SpTCs)。Samoyeds是首次同时应用于激活和模型参数的稀疏性。它引入了专为MoE计算量身定制的稀疏数据格式,并开发了专用的稀疏-稀疏矩阵乘法内核。此外,Samoyeds包含针对在SpTCs上执行双侧结构稀疏MoE LLMs的系统性优化,进一步提升了系统性能。评估显示,Samoyeds在内核级别上比SOTA工作高达1.99×,在模型级别上提升1.58×。此外,它提高了内存效率,将最大支持批量大小平均提高4.41倍。此外,Samoyeds在模型准确性和硬件可移植性方面均超越了现有的SOTA结构稀疏解决方案。
引用
@article{arxiv.2503.10725,
title = {Samoyeds: Accelerating MoE Models with Structured Sparsity Leveraging Sparse Tensor Cores},
author = {Chenpeng Wu and Qiqi Gu and Heng Shi and Jianguo Yao and Haibing Guan},
journal= {arXiv preprint arXiv:2503.10725},
year = {2025}
}