中文

从代码到游戏:使用大语言模型进行程序搜索基准测试

人工智能 2025-07-16 v2

摘要

大语言模型(LLM)在生成程序代码方面展现出惊人的能力,为将程序合成应用于游戏领域开辟了令人振奋的机遇。本文探索了LLM直接合成各种游戏应用可运行代码的潜力,主要关注两种编程语言:Python和Java。我们使用一种演化式爬坡算法,其中变异和初始程序的种子由LLM控制。对于Python,框架涵盖了包括五个迷你版Atari游戏、十个Baba is You关卡、一个受Asteroids启发的环境,以及一个迷宫生成任务。对于Java,框架包含来自TAG桌上游戏框架的12个游戏。在29个任务中,我们评估了12个Python模型和8个Java模型。我们的发现表明,LLM的性能更多取决于任务本身,而非模型规模。虽然更大的模型会生成更多可执行程序,但这些程序并不一定导致更高质量的解决方案,反而会大幅增加成本。没有哪个模型能明显领先,尽管在特定任务上,某个模型可能表现更好。通过在多个模型上尝试并选取最佳结果比仅使用一个模型更可靠。

关键词

引用

@article{arxiv.2412.04057,
  title  = {From Code to Play: Benchmarking Program Search for Games Using Large Language Models},
  author = {Manuel Eberhardinger and James Goodman and Alexander Dockhorn and Diego Perez-Liebana and Raluca D. Gaina and Duygu Çakmak and Setareh Maghsudi and Simon Lucas},
  journal= {arXiv preprint arXiv:2412.04057},
  year   = {2025}
}

备注

Submitted to Transactions on Games Special Issue on Large Language Models and Games, standardised LLMs used and run more experiments