中文

轮次注意力:加速大语言模型推理的新型轮次级注意力机制

计算与语言 2025-06-30 v3 人工智能

摘要

大语言模型(LLM)的上下文窗口大小不断增大,提高了其处理复杂长文本任务的能力。然而,随着对话轮次的持续增加,需要在GPU内存中存储大量KV缓存,这显著影响模型服务系统的效率甚至可用性。本文在轮次粒度上分析了真实用户的对话数据,发现LLM推理呈现出一个分水岭层级,此后轮次级注意力分布显示出显著的相似性。基于此,我们提出了轮次注意力(Round Attention)——一种新颖的轮次级注意力机制,通过选择性处理前k个相关轮次的KV缓存,其中k通过分水岭层级的注意力矩阵动态确定。理论分析表明,我们的方法可将内存使用量降低54%至82%,而实验结果确认,仅加载稀疏关键轮次KV缓存即可在不损失性能的同时保持答案准确性。

关键词

引用

@article{arxiv.2502.15294,
  title  = {Round Attention: A Novel Round-Level Attention Mechanism to Accelerate LLM Inference},
  author = {Yaohua Tang and Zhicheng Hu and Kun Cheng and Fan Mo and Qiheng Lv and Hua Wang and Zhi Chen},
  journal= {arXiv preprint arXiv:2502.15294},
  year   = {2025}
}