GAMEBoT:游戏中LLM推理能力的透明评估
计算与语言
2025-06-03 v2
摘要
大型语言模型(LLM)越来越多地部署在需要复杂推理的现实应用中。为了跟踪进展,需要稳健的基准来评估其超越表面模式识别的能力。然而,当前的LLM推理基准常常面临可解释性不足、性能饱和或数据污染等挑战。为了解决这些问题,我们引入了GAMEBoT,一个专为严格和透明评估LLM推理能力而设计的游戏竞技场。GAMEBoT将游戏中的复杂推理分解为预定义的模块化子问题。这种分解使我们能够设计一套思维链(CoT)提示,利用领域知识指导LLM在动作选择之前处理这些子问题。此外,我们开发了一套基于规则的算法来为这些子问题生成真实标签,从而能够严格验证LLM的中间推理步骤。这种方法有助于评估最终动作的质量以及底层推理过程的准确性。GAMEBoT还通过动态游戏和LLM之间的直接对抗自然降低了数据污染的风险。我们在八款游戏中评估了17个主流LLM,涵盖了各种战略能力和游戏特性。我们的结果表明,即使为LLM提供了详细的CoT提示,GAMEBoT也构成了重大挑战。项目页面:https://visual-ai.github.io/gamebot
引用
@article{arxiv.2412.13602,
title = {GAMEBoT: Transparent Assessment of LLM Reasoning in Games},
author = {Wenye Lin and Jonathan Roberts and Yunhan Yang and Samuel Albanie and Zongqing Lu and Kai Han},
journal= {arXiv preprint arXiv:2412.13602},
year = {2025}
}
备注
9 pages, ACL 2025