中文

TriAttention:通过三角KV压缩实现高效长推理

计算与语言 2026-04-07 v1 计算机视觉与模式识别

摘要

大语言模型(LLMs)中的扩展推理会产生严重的KV缓存内存瓶颈。领先的KV缓存压缩方法利用RoPE后查询的注意力分数来估计KV重要性。然而,查询在RoPE过程中随位置旋转,导致代表性查询极少,从而导致较差的关键选择和不稳定的推理。为了避免这个问题,我们转向RoPE前空间,在那里我们观察到Q和K向量高度集中在固定的非零中心附近,并且在各位置上保持稳定——即Q/K集中。我们证明这种集中导致查询优先关注特定距离处的键(例如最近的键),而中心通过三角级数决定哪些距离是优选的。基于此,我们提出TriAttention,通过利用这些中心来估计键的重要性。通过三角级数,我们利用这些中心所表征的距离偏好根据位置对键进行评分,同时也利用Q/K范数作为重要性估计的额外信号。在AIME25上使用32K-token生成时,TriAttention在保持完整注意力推理精度的同时实现了2.5倍的吞吐量提升或10.7倍的KV内存减少,而领先基线在相同效率下仅能达到约一半的精度。TriAttention使得OpenClaw能够在单个消费级GPU上部署,否则长上下文会导致完整注意力下的内存溢出。

关键词

引用

@article{arxiv.2604.04921,
  title  = {TriAttention: Efficient Long Reasoning with Trigonometric KV Compression},
  author = {Weian Mao and Xi Lin and Wei Huang and Yuxin Xie and Tianfu Fu and Bohan Zhuang and Song Han and Yukang Chen},
  journal= {arXiv preprint arXiv:2604.04921},
  year   = {2026}
}

备注

Code is available at https://github.com/WeianMao/triattention