均衡残差揭示矩阵博弈中语言模型的三种战略推理模式
机器学习
2026-05-12 v1
摘要
大型语言模型在命名博弈基准测试中得分良好,但在去除语义线索后的相同战略计算中表现失败。我们通过程序化生成的零和矩阵博弈展示了这一差距:在匿名 、 和 支付矩阵上,识别熟悉博弈的模型成功率分别下降至 34%、18% 和 2%。该基准分离了语义记忆、学习近似纳什计算以及一种限制规模的输出界面瓶颈。仅在 和 博弈上进行监督微调后,未见的 -- 成功率从 2% 提升至 61%,而剥削性奖励训练平均为 37%,且种子方差较大。我们证明,剥削性残差相对于支付扰动具有 2-Lipschitz 性,而与 discontinuous vertex-returning LP 均衡选择器不同,后者在格式不稳定性限制均衡性能时仍能将残差训练在支付偏移下迁移。 dominated-action padding 实验提供了因果证据:训练后的模型能够解决嵌入更大矩阵中的 博弈,而随机填充的控制组失败,稠密 博弈仍接近失败。因此,程序化评估是测量战略推理所必需的,残差奖励暴露了一种实际但受格式限制的近似均衡计算之路。
引用
@article{arxiv.2605.10410,
title = {Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models},
author = {Wenhua Nie and Binhan Luo and Zijie Meng and Jyh-Shing Roger Jang and Ching-Wen Ma},
journal= {arXiv preprint arXiv:2605.10410},
year = {2026}
}