TMGBench:用于评估 LLM 战略推理能力的系统性游戏基准
人工智能
2025-05-28 v2 计算机科学与博弈论
摘要
大语言模型的快速发展加速了其在推理方面的应用,其中战略推理正受到日益关注的注意。为了评估大语言模型的战略推理能力,游戏理论因其简洁结构而成为众多研究者的首选方法。然而,当前研究通常仅关注有限选择的游戏,导致游戏类型的覆盖范围不足。此外,经典游戏情景可能存在数据泄露风险,而所使用的基准测试往往缺乏可扩展性,难以满足对最新技术模型的评估需求。为此,我们提出 TMGBench,其特征包括全面的游戏类型覆盖、多样化的情景以及灵活的游戏组织。具体而言,我们纳入了由 Robinson-Goforth 2x2 游戏拓扑概括的全部 144 种游戏类型,作为我们基准中的经典游戏;我们还为每种经典游戏合成多样化、更高质量的游戏情景,我们称之为基于故事的游戏。最后,为了提供一个可持续的评估框架,以适应日益强大的 LLM,我们将上述游戏视为原子单元,通过顺序、平行和嵌套结构将其组织成更复杂的形式。我们对主流大语言模型进行了全面评估,覆盖理性推理、推理鲁棒性、Theory-of-Mind 能力以及复杂游戏形式中的推理。结果显示,大语言模型在战略推理过程的准确性和一致性方面仍存在缺陷,其对 Theory-of-Mind 的掌握程度各不相同。此外,还评估了 SOTA 模型如 o3-mini、Qwen3 和 deepseek-reasoner 在顺序、平行和嵌套游戏结构中的表现,结果凸显了 TMGBench 所带来的挑战。
关键词
引用
@article{arxiv.2410.10479,
title = {TMGBench: A Systematic Game Benchmark for Evaluating Strategic Reasoning Abilities of LLMs},
author = {Haochuan Wang and Xiachong Feng and Lei Li and Yu Guo and Zhanyue Qin and Dianbo Sui and Lingpeng Kong},
journal= {arXiv preprint arXiv:2410.10479},
year = {2025}
}