解放上下文长度:通过查询-键压缩的高效选择性注意力方法
计算与语言
2025-02-21 v1
摘要
在大型语言模型(LLMs)中高效处理长序列上下文仍是一个重大挑战。现有方法要么采用永久驱逐策略,要么按块选择令牌,可能导致关键信息丢失。我们提出了高效选择性注意力(ESA),这是一种新方法,通过在令牌级别高效选择最关键的令牌来计算注意力,从而扩展上下文长度。ESA通过将查询和键向量压缩到更低维表示来降低令牌选择的计算复杂度。在使用上下文长度为8k和32k的开源LLMs进行最大长度为256k的长序列基准测试中评估了ESA。ESA在各种任务中均优于其他选择性注意力方法,尤其是在需要检索多个信息片段的任务中表现更好,在各种任务中均实现了与全注意力外推方法相当的性能,在某些任务中取得优异结果。
引用
@article{arxiv.2502.14477,
title = {Unshackling Context Length: An Efficient Selective Attention Approach through Query-Key Compression},
author = {Haoyu Wang and Tong Teng and Tianyu Guo and An Xiao and Duyu Tang and Hanting Chen and Yunhe Wang},
journal= {arXiv preprint arXiv:2502.14477},
year = {2025}
}
备注
14 pages,2 figures