通过预评分实现高效注意力:在 Transformer 中优先处理信息丰富的键
机器学习
2026-02-10 v4
摘要
高效注意力机制使长上下文 Transformer 成为可能,但常常忽略全局重要标记,导致建模质量下降。我们引入一种预评分框架,在应用分层近似注意力之前为键分配查询独立的全局重要性先验。通过基于聚类的评分或杠杆样式评分,预评分识别结构信息丰富的键并将计算限制在此优先级子集上。集成到 HyperAttention 中后,预评分在长上下文语言建模中显著改善了近似质量:在 ChatGLM 上进行 131k token 上下文测试时,困惑度从 12.0 降至 9.5,同时保持亚二次效率。聚类-based 评分在相同键预算下一致优于杠杆-based 选择。除了语言任务,替换 Vision Transformer 中的自注意力机制也能保留大部分基准准确率,表明该方法跨模态均适用。我们在植入子空间模型下提供了结构保证,表明聚类可恢复与杠杆方法相同的重键集合。总体而言,预评分通过更好地优先处理信息丰富的键而改善了近似注意力的效率-准确性权衡,同时不牺牲可扩展性。
引用
@article{arxiv.2505.11040,
title = {Efficient Attention via Pre-Scoring: Prioritizing Informative Keys in Transformers},
author = {Zhexiang Li and Haoyu Wang and Yutong Bao and David Woodruff},
journal= {arXiv preprint arXiv:2505.11040},
year = {2026}
}