STILL: 用于线性化大语言模型的层内混合注意力中 token 选择
机器学习
2026-02-03 v1
摘要
线性化预训练的大语言模型(LLM)主要依赖层内混合注意力机制,以缓解标准软最大注意力的二次复杂度。现有方法基于滑动窗口分区进行 token 路由,导致基于位置的选择,无法捕获 token 特定的全局重要性。同时,线性注意力还受到可学习特征图引起的分布迁移的影响,这些特征图扭曲了预训练特征的幅度。鉴于这些限制,我们提出了 STILL,一种用于高效线性化大语言模型的层内混合线性化框架。STILL 引入具有强局部-全局一致性的自显著性得分,使我们能够使用滑动窗口计算进行准确的 token 选择,并保留重要 token 以进行稀疏软最大注意力,同时通过线性注意力总结剩余上下文。为保持预训练表示,我们设计了一种保持尺度的特征图(NP-Map),将特征方向与幅度解耦并重新注入预训练尺度。我们进一步采用统一的训练-推理架构,结合块状并行和延迟选择,以提高硬件效率。实验表明,STILL 在常识推理和一般推理任务上与原始预训练模型持平或更好, 在长上下文基准测试中相对于先前的线性化注意力方法实现了最高 86.2% 的相对改进。
引用
@article{arxiv.2602.02180,
title = {STILL: Selecting Tokens for Intra-Layer Hybrid Attention to Linearize LLMs},
author = {Weikang Meng and Liangyu Huo and Yadan Luo and Jiawen Guan and Jingyi Zhang and Yingjian Li and Zheng Zhang},
journal= {arXiv preprint arXiv:2602.02180},
year = {2026}
}