窄键,满值:通过低维注意力选择降低 KV 缓存
机器学习
2026-03-31 v4 人工智能
摘要
标准 Transformer 注意力机制中,查询、键和值使用的维度相同,但这些组件在不同方面发挥不同作用:查询和键产生标量注意力权重(选择),而值承载丰富的表示(价值传递)。我们表明,仅需 的维度即可区分 个相关 token 类别(例如语法角色、语义聚类、位置模式),远少于价值传递所需的维度。我们引入因式键(factored keys),利用这种不对称性,在无需从头重新训练的前提下缩小任何预训练模型的 KV 缓存——不同于需在预训练前设计的分组查询注意力(GQA)和多头潜在注意力(MLA)。我们通过截断奇异值分解(SVD)对每个键投影 进行因式分解(其中 为选定的压缩维度),将 作为新的键投影,以产生压缩后的 维键存入缓存,并将 吸收到查询投影中(),因为查询永远不会被缓存。以 7B 模型规模为例,使用 (其中 为模型维度)从头训练,训练 200 亿 token 后,与完整注意力的困惑度相当( vs PPL,两个随机种子的平均值),同时使用参数减少 12%,训练速度提升 8%。对于现有模型,采用 SVD 后进行查询-键微调(仅需 3 个 epoch,不足 1% 的预训练数据),可实现约 75% 的键缓存节省,在 GPT-2 和 Mistral-7B 上大约产生 2% 的性能代价。该方法可与 GQA 和量化组合,实现最高可达 的键缓存压缩。对于 7B 模型的 128K 上下文场景,因式键可为每个用户节省 25 GB 的 KV 缓存,从而在相同硬件下可实现约 60% 的并发用户数提升。
引用
@article{arxiv.2603.04427,
title = {Thin Keys, Full Values: Reducing KV Cache via Low-Dimensional Attention Selection},
author = {Hengshuai Yao and Xing Chen and Ahmed Murtadha and Guan Wang},
journal= {arXiv preprint arXiv:2603.04427},
year = {2026}
}