注意力的耦合查询-键动力学
机器学习
2026-04-03 v1 计算与语言
摘要
标准缩放点积注意力计算来自输入静态、独立投影的得分。我们表明,通过在计分之前对查询和键进行联合演化——称为\textbf{耦合查询-键动力学}——可改善语言建模困惑度和训练稳定性。在103M参数的 WikiText-103 上,耦合动力学实现22.55--22.62的困惑度,而标准注意力为24.22(提升6.6--6.9%),仅增加0.11%的参数(在两个实例中共享)。结构消融隔离了耦合作为活跃因素:当两个查询和键都进行耦合时,辛泊姆(哈密顿)和非辛泊姆(欧拉)积分器表现相同,而容量相当的未耦合MLP基线仅达到23.81,种子方差高出8倍。积分步数(1--7)同样无关紧要——仅需一步耦合即可。与计算匹配的比较揭示,耦合是一种样本效率机制:标准注意力训练延长2.4倍(匹配运行时间)即可达到相同困惑度,但需要2.4倍的标记。优势在150M参数时为-6.7%,但在350M参数时缩小至-1.0%,此时微分注意力(18.93)超过耦合动力学(19.35)。该优势取决于语料库:在领域连贯文本(WikiText-103降低6.6%,PubMed降低4.5%)中有益,但在异构网络文本中有负面影响(提升10.3%),在GLUE上无显著效果。我们对何时耦合有益以及何时不有益进行了表征,提供了实用指南。
引用
@article{arxiv.2604.01683,
title = {Coupled Query-Key Dynamics for Attention},
author = {Barak Gahtan and Alex M. Bronstein},
journal= {arXiv preprint arXiv:2604.01683},
year = {2026}
}