多头注意力是一场多玩家游戏
人工智能
2026-02-03 v1 计算与语言
计算机科学与博弈论
机器学习
摘要
现代变换器注意力在内部是多智能体 — — 头部相互竞争和协调 — — 但我们仍像对待单一优化器一样训练它。我们形式化这一差距:交叉熵训练在头部间引发隐式潜在游戏,梯度下降收敛至纳什均衡,可能因未定价外部性(冗余、相关错误)导致效率损失。我们的主要结果通过界定头部交互矩阵 的非对角质量,给出博弈代价(Price of Anarchy)的上界。 在温和光滑性假设下,我们证明“多余幻觉概率”和“多余头部冗余”均随 PoA 比例增长,将两种不同的失效模式统一为单一机制。该界限具有操作意义:正则化可降低 以严格收紧 PoA。我们将其实现为 GAME-LoRA,结合 Barlow Twins 去相关与行列式协调压力。实验验证了理论: 预测幻觉发生(),新兴联盟表现出选择性协调,GAME-LoRA 实现最高 18% 幻觉减少(平均 8%),且无知识退化 — — 这是一个无法被忽视博弈结构方法实现的帕累托改进。
引用
@article{arxiv.2602.00861,
title = {Multi-Head Attention Is a Multi-Player Game},
author = {Kushal Chakrabarti and Nirmal Balachundar},
journal= {arXiv preprint arXiv:2602.00861},
year = {2026}
}