Krause 同步 Transformer
机器学习
2026-05-26 v4 人工智能
摘要
Transformer 中的自注意力依赖于全局归一化的 softmax 权重,导致每个 token 在每层都竞争影响力。当跨层组合时,这种交互模式诱导强大的同步动力学,使其倾向于收敛到主导模式,与表示坍缩和注意力沉底现象相关。我们引入 Krause 注意力,这是一种受有界信心共识动力学启发的注意力机制。Krause 注意力将基于相似性的全局聚合替换为基于距离的局部、选择稀疏的交互,促进结构化的局部同步而非全局混合。我们将这种行为与最近将 Transformer 动力学建模为相互作用粒子系统的理论联系起来,展示有界信心交互如何自然缓解注意力集中并缓解注意力沉底。将交互限制为局部邻域还可将序列长度的运行复杂度从二次降低到线性。经验上,我们在多个场景下验证了 Krause 注意力,包括视觉任务(CIFAR/ImageNet 上的 ViT)、自回归图像生成(MNIST/CIFAR-10)、大语言模型(Llama/Qwen)以及多个规模(100M/200M)从头训练的语言模型。跨域测试表明,Krause 注意力在保持一致性能提升的同时显著提高计算效率,凸显有界信心动力学作为注意力可扩展且有效的归纳偏置。
关键词
引用
@article{arxiv.2602.11534,
title = {Krause Synchronization Transformers},
author = {Jingkun Liu and Yisong Yue and Max Welling and Yue Song},
journal= {arXiv preprint arXiv:2602.11534},
year = {2026}
}
备注
ICML 2026, Project page: https://jingkun-liu.github.io/krause-sync-transformers/