DeepSeek 多头潜在注意力的以硬件为中心的分析
硬件体系结构
2026-04-10 v1
摘要
DeepSeek-V2 中引入的多头潜在注意力(MLA)通过将查询、键和值张量投影到紧凑的潜在空间,提高了大型语言模型的效率。这种架构变化减小了 KV 缓存大小,并显著降低了内存带宽需求,特别是在自回归解码阶段。本文对 MLA 进行了首次以硬件为中心的分析,将其与传统的多头注意力(MHA)进行比较,并评估其对加速器性能的影响。我们识别了 MLA 的两种替代执行方案——分别重用和重新计算潜在投影矩阵——它们在计算和内存访问之间提供了不同的权衡。使用 Stream 设计空间探索框架,我们对它们在一系列硬件平台上的吞吐量和能耗成本进行了建模,发现 MLA 可以将注意力工作负载向计算受限区域转移。我们的结果表明,MLA 不仅减少了带宽使用,而且能够实现与硬件约束相一致的自适应执行策略。与 MHA 相比,它提供了更稳定和高效的性能,特别是在带宽受限的硬件平台上。这些发现强调了 MLA 作为未来 AI 加速器协同设计机遇的重要性。
引用
@article{arxiv.2506.02523,
title = {Hardware-Centric Analysis of DeepSeek's Multi-Head Latent Attention},
author = {Robin Geens and Marian Verhelst},
journal= {arXiv preprint arXiv:2506.02523},
year = {2026}
}