LUCID:带预条件表示的注意力机制
机器学习
2026-02-12 v1
摘要
Softmax基于点积注意力是Transformer架构的基石,赋予了如原语学习等突出能力。然而,随着上下文长度的增加,softmax函数的根本局限浮现:它倾向于将概率质量扩散到无关标记,削弱长序列情境下的性能。此外,降低softmax温度以锐化聚焦的尝试因梯度消失而降低可学习性。我们引入LUCID注意力,这是一种对注意力概率施加预条件器的架构修改。该预条件器源自指数化的键-键相似性,最小化RKHS空间内键之间的重叠,从而允许查询在大量键中准确聚焦于重要键,同时保持与标准注意力相同的计算复杂度。此外,LUCID的预条件化方法在检索方面无需低温,规避了其可学习性问题。我们通过训练约10亿参数的语言模型,在最高达128K token的序列长度上进行评估。结果表明,LUCID在长序列检索任务上显著提升,尤其在BABILong和RULER等基准测试中分别实现了最高达18%与14%的性能提升。
引用
@article{arxiv.2602.10410,
title = {LUCID: Attention with Preconditioned Representations},
author = {Sai Surya Duvvuri and Nirmal Patel and Nilesh Gupta and Inderjit S. Dhillon},
journal= {arXiv preprint arXiv:2602.10410},
year = {2026}
}