中文

多头注意力是一场多玩家游戏

人工智能 2026-02-03 v1 计算与语言 计算机科学与博弈论 机器学习

摘要

现代变换器注意力在内部是多智能体 — — 头部相互竞争和协调 — — 但我们仍像对待单一优化器一样训练它。我们形式化这一差距:交叉熵训练在头部间引发隐式潜在游戏,梯度下降收敛至纳什均衡,可能因未定价外部性(冗余、相关错误)导致效率损失。我们的主要结果通过界定头部交互矩阵 Γ(G)\Gamma(G) 的非对角质量,给出博弈代价(Price of Anarchy)的上界。 在温和光滑性假设下,我们证明“多余幻觉概率”和“多余头部冗余”均随 PoA 比例增长,将两种不同的失效模式统一为单一机制。该界限具有操作意义:正则化可降低 Γ(G)\Gamma(G) 以严格收紧 PoA。我们将其实现为 GAME-LoRA,结合 Barlow Twins 去相关与行列式协调压力。实验验证了理论:Γ(G)\Gamma(G) 预测幻觉发生(p<0.05p{<}0.05),新兴联盟表现出选择性协调,GAME-LoRA 实现最高 18% 幻觉减少(平均 8%),且无知识退化 — — 这是一个无法被忽视博弈结构方法实现的帕累托改进。

关键词

引用

@article{arxiv.2602.00861,
  title  = {Multi-Head Attention Is a Multi-Player Game},
  author = {Kushal Chakrabarti and Nirmal Balachundar},
  journal= {arXiv preprint arXiv:2602.00861},
  year   = {2026}
}