大型语言模型为何抑制纳什均衡博弈中的行为?——来自机械证据与因果控制
计算机科学与博弈论
2026-05-05 v2 人工智能
机器学习
摘要
大型语言模型代理已知在战略互动中偏离纳什均衡,但目前无人深入模型内部探究其原因,或询问这种偏离是否可被逆转。我们两手双行。与四个开源模型 (Llama-3 和 Qwen2.5,参数量从 8B 到 72B) 进行交互,玩家为四类经典两人博弈,我们通过自我对弈和交叉对弈实验建立行为图景,然后深入 32 层 Llama-3-8B 模型,考察其在战略决策中实际发生的事情。机械学发现十分清晰:对手历史在第一层以近乎完美的保真度被编码(探测准确率达 96%),随后逐层消耗;而纳什行动编码始终较弱,始终未超过 56%。模型中不存在专门的纳什模块。相反,模型在前向传播的大多数阶段私下偏好纳什行动,但最终由基于人类文本的前训练所构成的利他主义覆盖机制在后期层次逆转这一偏好,在第 30 层实现 84% 的合作概率。注入一个已学习的纳什方向到残差流中可双向、因果地改变行为,经概念夹紧验证。行为实验揭示了六项与规模和架构相关的发现,其中最显著的是:链式思考推理在小模型中恶化纳什博弈表现,但在 70B 参数以上模型中实现近乎完美的纳什博弈。交叉对弈实验揭示了三个在自我对弈中难以察觉的现象:小模型可通过提前投诉解构任何合作伙伴的合作意向;两个大模型相互强化彼此的合作本能;先手决定系统达到的具体纳什均衡。大型语言模型并不缺乏纳什博弈能力。它们计算出纳什行为,然后抑制了它。
引用
@article{arxiv.2604.27167,
title = {What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control},
author = {Paraskevas V. Lekeas and Giorgos Stamatopoulos},
journal= {arXiv preprint arXiv:2604.27167},
year = {2026}
}
备注
11 pages, 5 figures, 4 tables