Game Reasoning Arena:用于通过游戏评估大语言模型推理能力的框架与基准
人工智能
2025-08-19 v3 计算机科学与博弈论
摘要
Game Reasoning Arena 库提供了一个框架,用于通过Google OpenSpiel库中实现的战略棋类游戏来评估大语言模型(LLMs)的决策能力。该框架通过封装多种棋类和矩阵游戏,支持不同类型的智能体(随机智能体、启发式智能体、强化学习智能体等),实现对LLM基于智能体与其他智能体在各种游戏情景中的系统比较。它集成了通过liteLLM访问模型、通过vLLM进行本地模型部署,并通过Ray提供分布式执行。本文概述了该仓库的结构、关键特征及动机,强调其如何为LLM推理和博弈论行为的实证评估做出贡献。
引用
@article{arxiv.2508.03368,
title = {Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play},
author = {Lucia Cipolina-Kun and Marianna Nezhurina and Jenia Jitsev},
journal= {arXiv preprint arXiv:2508.03368},
year = {2025}
}