轮次注意力:加速大语言模型推理的新型轮次级注意力机制
计算与语言
2025-06-30 v3 人工智能
摘要
大语言模型(LLM)的上下文窗口大小不断增大,提高了其处理复杂长文本任务的能力。然而,随着对话轮次的持续增加,需要在GPU内存中存储大量KV缓存,这显著影响模型服务系统的效率甚至可用性。本文在轮次粒度上分析了真实用户的对话数据,发现LLM推理呈现出一个分水岭层级,此后轮次级注意力分布显示出显著的相似性。基于此,我们提出了轮次注意力(Round Attention)——一种新颖的轮次级注意力机制,通过选择性处理前k个相关轮次的KV缓存,其中k通过分水岭层级的注意力矩阵动态确定。理论分析表明,我们的方法可将内存使用量降低54%至82%,而实验结果确认,仅加载稀疏关键轮次KV缓存即可在不损失性能的同时保持答案准确性。
引用
@article{arxiv.2502.15294,
title = {Round Attention: A Novel Round-Level Attention Mechanism to Accelerate LLM Inference},
author = {Yaohua Tang and Zhicheng Hu and Kun Cheng and Fan Mo and Qiheng Lv and Hua Wang and Zhi Chen},
journal= {arXiv preprint arXiv:2502.15294},
year = {2025}
}