Baba is LLM:动态规则下的推理游戏
人工智能
2025-06-25 v1
摘要
大语言模型(LLM)在语言任务上表现良好,但在推理任务中存在困难。本文探讨了LLM玩 2D 解谜游戏 Baba is You 的能力,该游戏要求玩家通过重新排列定义对象属性的文本块来操控规则。在规则操控依赖语言能力和推理的情况下,该游戏是LLM的引人入目的挑战。我们评估了六种LLM,使用包括 (1) 简单提示、(2) 规则扩展提示和 (3) 行动扩展提示的不同提示类型。此外,对两种模型(Mistral、OLMo)进行微调,使用来自该游戏的文本和结构数据。结果表明,较大模型(尤其是 GPT-4o)在推理和解谜方面表现更好,而较小的未适应模型在识别游戏机制或应用规则更改方面则感到困难。微调提高了模型分析游戏水平的能力,但并未显著提高解题方案的制定能力。我们得出结论,即使对于最先进且经过微调的LLM,针对动态规则变更的推理仍然困难( Specifically,理解 use-mention 区分)。这些结果为探讨LLM应用于复杂问题解决任务的可行性,以及突出具有动态变化规则的游戏用于测试LLM推理和反思能力提供了见解。
关键词
引用
@article{arxiv.2506.19095,
title = {Baba is LLM: Reasoning in a Game with Dynamic Rules},
author = {Fien van Wetten and Aske Plaat and Max van Duijn},
journal= {arXiv preprint arXiv:2506.19095},
year = {2025}
}