Mugi:面向高效 LLM 的值级并行
机器学习
2026-02-05 v2 硬件体系结构
摘要
值级并行 被提出用于提高对称激活和权重之间大批量、低精度通用矩阵乘法 (GEMM) 的效率。在基于 Transformer 的大语言模型 中,存在超出激活-权重 GEMM 的更复杂操作。在本文中,我们探讨了 VLP 如何使 LLM 受益。首先,我们将 VLP 推广用于非线性近似,在端到端 LLM 的准确性、性能和效率上优于现有的非线性近似方法。我们的 VLP 近似遵循以值为中心的方法,其中重要的值被赋予更高的精度。其次,我们针对具有非对称输入的小批量 GEMM 高效地优化了 VLP,这利用了及时的 LLM 优化,包括仅权重量化、键值 (KV) 缓存量化和组查询注意力。最后,我们设计了一种新的 VLP 架构 Mugi,以封装上述创新并支持完整的 LLM 工作负载,同时提供更好的性能、效率和可持续性。我们的实验结果表明,Mugi 在吞吐量和能效上可以提供显著提升,对于非线性 softmax 操作分别高达 和 ,对于 LLM 分别为 和 ,并且还将 LLM 运行的运行碳排放降低了 ,隐含碳排放降低了 。
引用
@article{arxiv.2601.10823,
title = {Mugi: Value Level Parallelism For Efficient LLMs},
author = {Daniel Price and Prabhu Vellaisamy and John Shen and Di Wu},
journal= {arXiv preprint arXiv:2601.10823},
year = {2026}
}
备注
2026 International Conference on Architectural Support for Programming Languages and Operating Systems