面向经济推理:启用 DeepSeek 多头潜在注意力于任何基于 Transformer 的 LLM
计算与语言
2025-10-06 v2 人工智能
摘要
多头潜在注意力 (MLA) 是 DeepSeek 提出的一种创新架构,旨在通过显著压缩 Key-Value (KV) 缓存中的内容到潜在向量,从而确保高效经济的推理。与 MLA 相比,标准 LLM 使用 Multi-Head Attention (MHA) 及其变体如 Grouped-Query Attention (GQA) 在成本方面存在显著劣势。为使经过良好训练的 LLM(如 Llama)能够快速适应 MLA 而无需从头训练具有重要意义且充满挑战。本文提出首个针对从 MHA 转换到 MLA (MHA2MLA) 的数据高效微调方法,包括两个关键组件:对于部分-RoPE,我们移除对注意力得分贡献较小的查询和键维度的 RoPE;对于低秩近似,我们基于预训练的键和值参数引入联合 SVD 近似。通过这些精心设计的策略,MHA2MLA 仅需少量数据(0.3% 到 0.6%)即可恢复性能,显著降低推理成本 while seamless 集成到诸如 KV 缓存量化等压缩技术。例如,Llama2-7B 的 KV 缓存大小降低 92.19%,仅在 LongBench 性能下降 0.5%。
引用
@article{arxiv.2502.14837,
title = {Towards Economical Inference: Enabling DeepSeek's Multi-Head Latent Attention in Any Transformer-based LLMs},
author = {Tao Ji and Bin Guo and Yuanbin Wu and Qipeng Guo and Lixing Shen and Zhan Chen and Xipeng Qiu and Qi Zhang and Tao Gui},
journal= {arXiv preprint arXiv:2502.14837},
year = {2025}
}
备注
16 pages, 8 figures; Accepted to ACL 2025