突破二次方障碍:面向超长上下文视界的非注意力 LLM
机器学习
2025-06-04 v1 计算与语言
摘要
我们提出了一种用于大型语言模型的新型非注意力架构,该架构能够高效处理数十万乃至数百万 token 级别的超长上下文窗口。传统的 Transformer 设计由于自注意力机制的性质,会受到二次方内存和计算开销的困扰,而我们的模型完全避免了 token 到 token 的注意力机制。相反,它结合了以下互补组件:学习连续时间卷积核且随序列长度接近线性缩放的状态空间块(受 S4 启发);在不同膨胀级别捕捉局部上下文的多分辨率卷积层;用于在连续块之间维护全局隐藏状态的轻量级循环监督器;以及存储和检索高级块嵌入而不重新引入二次方操作的检索增强外部记忆。
引用
@article{arxiv.2506.01963,
title = {Breaking Quadratic Barriers: A Non-Attention LLM for Ultra-Long Context Horizons},
author = {Andrew Kiruluta and Preethi Raju and Priscilla Burity},
journal= {arXiv preprint arXiv:2506.01963},
year = {2025}
}