中文

TyphoonMLA:面向共享前缀的混合Naive-Absorb MLA核

机器学习 2026-02-13 v2 人工智能

摘要

多头潜在注意(Multi-Head Latent Attention, MLA)是近期采用于DeepSeek-v3和Kimi K2等顶级LLM的注意力机制。得益于其新颖的公式,MLA允许两种功能等价但计算上存在差异的内核实现:naive与absorb。虽然naive内核(如FlashAttention)在训练和预填充阶段因计算效率通常受青睐,但现有解码内核(如FlashMLA)依赖absorb方法以最小化HBM带宽使用。然而,absorb实现的计算受限特性阻碍了注意力计算中数据复用机会(如共享前缀)的性能收益。在本工作中,我们引入TyphoonMLA,一种将naive与absorb公式组合以发挥两者优势的混合方法。TyphoonMLA通过对注意力计算中计算受限的部分应用naive公式,同时对非共享部分采用absorb公式来降低带宽需求,从而有效利用共享前缀。结果表明,TyphoonMLA在MLA架构中提升了注意力计算吞吐量,在NPU和GPU上分别提升最高可达3倍和3.24倍,仅增加约3%的HBM大小开销。

关键词

引用

@article{arxiv.2509.21081,
  title  = {TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix},
  author = {Ahmet Caner Yüzügüler and Ahmet Çelik and Jiawei Zhuang and Lukas Cavigelli},
  journal= {arXiv preprint arXiv:2509.21081},
  year   = {2026}
}