基于偏差理论的流式注意力近似
机器学习
2026-03-25 v3 人工智能
数据结构与算法
摘要
大型语言模型(LLM)取得了显著的成功,但其高内存需求为长序列token生成带来了挑战。本文研究了注意力近似的流式复杂度,这是支撑token生成的关键计算原语。我们的主要贡献是BalanceKV,这是一种基于巴纳斯茨坎果向量平衡理论,用于选择平衡的Key和Value token集合,以实现近似注意力计算的流式算法。我们还提供了流式注意力计算的空间复杂度下界。除了强大的理论保证之外,BalanceKV在各种长上下文基准测试中,针对注意力近似和端到端性能都显示出实证验证的性能提升。
引用
@article{arxiv.2502.07861,
title = {Streaming Attention Approximation via Discrepancy Theory},
author = {Ekaterina Kochetkova and Kshiteej Sheth and Insu Han and Amir Zandieh and Michael Kapralov},
journal= {arXiv preprint arXiv:2502.07861},
year = {2026}
}