中文

Kwai Summary Attention 技术报告

计算与语言 2026-04-28 v1 人工智能 信息检索 机器学习

摘要

长上下文能力已成为下一代大语言模型最重要的迭代方向,尤其在语义理解/推理、代码智能体和推荐系统方面。然而,标准的softmax注意力机制随序列长度呈二次时间复杂度。在序列长度增加时,这会在长上下文场景中造成巨大的开销,导致极端长序列的训练和推理成本急剧恶化。现有解决方案通过两种技术路径来缓解此问题:i) 减少每层的KV缓存,如从头级压缩GQA,或嵌入维度级压缩MLA,但KV缓存仍以1:1比例线性依赖于序列长度;ii) 与KV缓存友好型架构交错,如局部注意力SWA、线性核GDN,但常在KV缓存和长上下文建模效果之间权衡。除了这两种技术路径,我们认为存在一种未得到充分探索的中间路径:{保持KV缓存与序列长度之间的线性关系,但通过特定比例k进行语义水平压缩}。这种O(n/k)路径并非追求“最小化KV缓存”,而是以可接受的内存成本为代价,换取对长程依赖的完整、可引用且可解释的保留。以此为动机,我们提出Kwai Summary Attention (KSA),一种新型注意力机制,通过压缩历史上下文为可学习的摘要标记来降低序列建模成本。

关键词

引用

@article{arxiv.2604.24432,
  title  = {Kwai Summary Attention Technical Report},
  author = {Chenglong Chu and Guorui Zhou and Guowang Zhang and Han Li and Hao Peng and Hongtao Cheng and Jian Liang and Jiangxia Cao and Kun Gai and Lingzhi Zhou and Lu Ren and Qi Zhang and Ruiming Tang and Ruitao Wang and Xinchen Luo and Yi Su and Zhiyuan Liang and Ziqi Wang and Boyang Ding and Chengru Song and Dunju Zang and Hui Wang and Jiao Ou and Jiaxin Deng and Jijun Shi and Jinghao Zhang and Junmin Chen and Lejian Ren and Minxuan Lv and Qianqian Wang and Qigen Hu and Shiyao Wang and Siyang Mao and Tao Wang and Xingmei Wang and Zhixin Ling and Ziming Li and Zixing Zhang},
  journal= {arXiv preprint arXiv:2604.24432},
  year   = {2026}
}

备注

Work in progress