GENSTRAT:面向大语言模型的战略推理科学
人工智能
2026-05-25 v1 计算机科学与博弈论
机器学习
多智能体系统
摘要
大型语言模型 (LLM) 正在越来越多地作为经济体在市场、拍卖和出价场景中部署。预测它们在特定部署中的行为具有挑战性。现有的战略推理基准在固定规范游戏上评估模型,这些基准可能随着前沿进步而饱和,且不能让评估者对从基准性能对实际部署涉及的多样化且复杂的战略环境进行自信的推广。我们引入 GENSTRAT,使用程序化生成的战略环境来解决这些挑战。具体而言,我们生成两个玩家的零和不完全信息牌类游戏的分布。生成器可以在需要时抽取新的游戏,实现持续的评估并抵抗污染。我们将游戏分布与能力概述方法结合,用于在六个维度上分解模型能力(状态空间、时间深度、信息敏感性、对手建模、风险和脆弱性)。我们还引入一种锋利度度量,用于检测模型优势在战略上相似的游戏之间出现不可预测的跳跃。我们从 2000 游戏中抽取 50 个基准游戏,在超过 36000 场比赛中对九个前沿和开源权重 LLM 进行公开对决。较新的前沿级模型在平均得分上更高。除平均得分外,得分相近的模型显示出质差异的能力概述,排名前三的模型中两个(gpt-5 和 claude)在局部波动性上明显高于第三个(gemini-3.1-pro),尽管其整体实力接近。总之,能力概述和锋利度度量提供了一个与整体排名无法提供的部署相关诊断。
引用
@article{arxiv.2605.23238,
title = {GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models},
author = {Vartan Shadarevian and Kia Ghods and Alex Kenich and Anany Kotawala},
journal= {arXiv preprint arXiv:2605.23238},
year = {2026}
}
备注
33 pages, 8 figures, 9 tables (4 figures, 2 tables in main paper)