中文

Game Reasoning Arena:用于通过游戏评估大语言模型推理能力的框架与基准

人工智能 2025-08-19 v3 计算机科学与博弈论

摘要

Game Reasoning Arena 库提供了一个框架,用于通过Google OpenSpiel库中实现的战略棋类游戏来评估大语言模型(LLMs)的决策能力。该框架通过封装多种棋类和矩阵游戏,支持不同类型的智能体(随机智能体、启发式智能体、强化学习智能体等),实现对LLM基于智能体与其他智能体在各种游戏情景中的系统比较。它集成了通过liteLLM访问模型、通过vLLM进行本地模型部署,并通过Ray提供分布式执行。本文概述了该仓库的结构、关键特征及动机,强调其如何为LLM推理和博弈论行为的实证评估做出贡献。

关键词

引用

@article{arxiv.2508.03368,
  title  = {Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play},
  author = {Lucia Cipolina-Kun and Marianna Nezhurina and Jenia Jitsev},
  journal= {arXiv preprint arXiv:2508.03368},
  year   = {2025}
}