中文

MoSKA:用于高效长序列 LLM 推理的共享 KV 注意力混合机制

机器学习 2025-11-11 v1 人工智能 分布式、并行与集群计算

摘要

大型语言模型(LLM)不断增长的上下文长度在 Key-Value(KV)缓存周围造成了严重的性能瓶颈,其受限于内存带宽的特性导致 GPU 利用率严重不足。本文提出了共享 KV 注意力混合机制,这是一种通过利用上下文数据的异构性来应对上述挑战的架构。该架构区分了每个请求独有的序列与被大规模重用的共享序列。MoSKA 的核心是一种新颖的共享 KV 注意力机制,它通过批处理并发请求,将对共享数据的注意力计算从一系列受限于内存带宽的 GEMV 操作转化为单次受限于计算能力的 GEMM 操作。该机制得到了受 MoE 启发的稀疏注意力策略(用于修剪搜索空间)以及定制解耦基础设施(针对独有数据和共享数据专用硬件)的支持。这种综合方法在具有高上下文共享度的工作负载中,展现出相比基线高达 538.7 倍的吞吐量提升,为可扩展的 LLM 推理提供了一条清晰的架构路径。

关键词

引用

@article{arxiv.2511.06010,
  title  = {MoSKA: Mixture of Shared KV Attention for Efficient Long-Sequence LLM Inference},
  author = {Myunghyun Rhee and Sookyung Choi and Euiseok Kim and Joonseop Sim and Youngpyo Joo and Hoshik Kim},
  journal= {arXiv preprint arXiv:2511.06010},
  year   = {2025}
}

备注

4 pages, 5 figures, accepted for publication at IEEE Computer Architecture Letters (IEEE CAL), 2025