中文

CARE: 协方差感知与秩增强分解以实现多头潜在注意力

机器学习 2026-03-19 v1 人工智能

摘要

将预训练的注意力模块(如分组查询注意力 GQA)转换为多头潜在注意力(MLA)可以在不增加 KV 缓存开销的情况下提升表达能力,使其对高效推理具有吸引力。然而,许多实际的转换基线方法依赖于仅权重的低秩近似(如 SVD 风格初始化)和均匀秩分配。它们关注最小化权重矩阵之间的差异,而非这些权重如何影响输入激活,忽略了激活的协方差结构,并在各层强制均匀秩,导致激活漂移和注意力保真度下降。为了解决这些问题,我们提出了 CARE,一个在固定 KV 宽度下的协方差感知、秩增强 MLA 转换流水线。CARE 引入三个关键步骤:(i)激活保持分解,将近似与实际输入激活对齐而非仅与权重对齐;(ii)调整秩分配,通过为最需要的层分配更多容量,将固定 KV 预算在各层间展开;(iii)KV 奇偶映射,在保持 KV 缓存大小不变的情况下,将转换后的 K 和 V 重参数化以适配 MLA 格式。我们的方法在 Qwen3-4B/30B-A3B-Instruct-2507 和 Llama-3.1-8B/70B-Instruct 上优于均匀秩 SVD 基线,在匹配 KV 预算下,将一次性困惑度降低高达 215 倍,将平均准确率提升高达 1.70 倍。通过简短的 SVD 后修复微调,我们完全恢复了原始模型的准确率。

关键词

引用

@article{arxiv.2603.17946,
  title  = {CARE: Covariance-Aware and Rank-Enhanced Decomposition for Enabling Multi-Head Latent Attention},
  author = {Zhongzhu Zhou and Fengxiang Bie and Ziyan Chen and Zhenyu Zhang and Yibo Yang and Junxiong Wang and Ben Athiwaratkun and Xiaoxia Wu and Shuaiwen Leon Song},
  journal= {arXiv preprint arXiv:2603.17946},
  year   = {2026}
}

备注

Accepted at ICLR 2026. Conference paper. 10 pages main text; 34 pages total including references and appendix. 11 figures and 20 tables in total