中文

利用LLM代理进行自动化视频游戏测试

软件工程 2025-09-29 v1

摘要

测试大型多人在线角色扮演游戏(MMORPG)是游戏开发中关键但劳动密集型的任务,因其复杂性和频繁更新的特性。传统自动化游戏测试方法难以在这些丰富、开放的环境中实现高状态覆盖率和效率,而现有的基于LLM的游戏玩法方法在理解复杂游戏状态-动作空间和长复杂任务方面仅限于浅层推理能力。为应对这些挑战,我们提出了TITAN,一个有效的LLM驱动代理框架,用于智能MMORPG测试。TITAN包含四个关键组件:(1)感知并抽象高维游戏状态,(2)主动优化和优先级排序可用动作,(3)通过动作轨迹记忆和反思性自纠错实现长时序推理,(4)利用基于LLM的预言机检测潜在的功能和逻辑缺陷并生成诊断报告。我们实现了TITAN的原型,并在两个涵盖PC和移动平台的大规模商业MMORPG上进行了评估。在实验中,TITAN实现了显著更高的任务完成率(95%)和缺陷检测性能。消融研究进一步表明TITAN的每个核心组件对其整体性能贡献显著。值得注意的是,TITAN检测到了先前测试方法未能识别的四个未知缺陷。我们对这些结果进行了深入讨论,为推进智能通用测试系统的新方向提供了指导。此外,TITAN已部署在八个真实游戏QA流程中,凸显了其作为LLM驱动游戏测试框架的实际影响。

关键词

引用

@article{arxiv.2509.22170,
  title  = {Leveraging LLM Agents for Automated Video Game Testing},
  author = {Chengjia Wang and Lanling Tang and Ming Yuan and Jiongchi Yu and Xiaofei Xie and Jiajun Bu},
  journal= {arXiv preprint arXiv:2509.22170},
  year   = {2025}
}

备注

17 pages