Boardwalk: 面向LLM创建棋盘游戏的框架
机器学习
2025-11-10 v2
摘要
在代码中实现棋盘游戏可能是一项耗时的任务。然而,大语言模型(LLM)已被证明在仅需简单上下文信息的情况下能够有效生成特定领域的代码。我们旨在调查LLM是否能够从自然语言描述的规则中实现数字版棋盘游戏。这将是一步 towards LLM协助框架,用于快速棋盘游戏代码生成的步骤。我们期望确定LLM实现棋盘游戏的主要挑战,以及不同方法和模型之间的差异。我们让三个最先进的LLM(Claude、DeepSeek和ChatGPT)在自由形式和Boardwalk中实现我们提出的通用游戏玩法API within Boardwalk的12种流行和不常见的游戏。我们对游戏和组件进行匿名化,以避免触发预训练LLM的知识。通过可玩性和规则合规性测试评估实现情况。我们评估了不同LLM和游戏流行度下的成功率和常见错误。我们的表明方法是可行的,表现最好的模型Claude 3.7 Sonnet以55.6%的比例实现了无任何错误的游戏。尽管API合规性会增加错误频率,但错误严重程度更大程度上取决于LLM本身。我们概述了为创建集成此过程的框架的未来步骤,使棋盘游戏的 elaboration 更加可及。
引用
@article{arxiv.2508.16447,
title = {Boardwalk: Towards a Framework for Creating Board Games with LLMs},
author = {Álvaro Guglielmin Becker and Gabriel Bauer de Oliveira and Lana Bertoldo Rossato and Anderson Rocha Tavares},
journal= {arXiv preprint arXiv:2508.16447},
year = {2025}
}
备注
Presented at SBGames 2025