中文

面向 LLM 的自动游戏测试方法探索

软件工程 2025-07-15 v1

摘要

游戏测试是人们玩视频游戏进行测试的过程,这对于游戏软件的质量保证至关重要。手动游戏测试耗时且昂贵。然而,自动化这一过程具有挑战,因为游戏测试通常需要领域知识和解决问题的技能,而大多数传统测试工具缺乏这些能力。近期的人工智能(AI)进展为将大语言模型(LLM)应用于游戏测试开辟了新可能性。然而,仍存在显著挑战:当前的 LLM 无法感知游戏环境,大多数现有研究聚焦于文本游戏或具有健全 API 的游戏。许多非文本游戏缺乏 API 来提供游戏状态的文本描述,这几乎不可能直接应用于 LLM 进行游戏测试。本文介绍了 Lap,我们的一种 novel 方法用于 LLM 基于自动游戏测试,该方法使用 ChatGPT 测试匹配-3 游戏,这是一种玩家将三个或更多相同图块在一行或列中匹配以获得分数的游戏类别。Lap 包含三个关键阶段:游戏环境处理、基于提示的动作生成和动作执行。给定一个匹配-3 游戏,Lap 对游戏板进行快照并将其转换为数值矩阵。它然后提示 ChatGPT-O1-mini API 基于该矩阵建议动作,并临时应用所建议的动作以获得分数并触发游戏板上的变化。它重复上述三个步骤,直到超时。对于评估,我们在开源匹配-3 游戏 CasseBonbons 上进行了案例研究,并与三个现有工具进行了经验比较。我们的结果令人振奋:Lap 在实现更高的代码覆盖率和触发更多程序崩溃方面优于现有工具。这项研究为自动化测试和 LLM 应用的未来提供了启示。

关键词

引用

@article{arxiv.2507.09490,
  title  = {Towards LLM-Based Automatic Playtest},
  author = {Yan Zhao and Chiwei Tang},
  journal= {arXiv preprint arXiv:2507.09490},
  year   = {2025}
}