中文

大语言模型是相当不错的零样本电子游戏缺陷检测器

计算与语言 2022-10-07 v1 软件工程

摘要

电子游戏测试需要游戏特定知识以及对游戏中事件的常识推理。虽然AI驱动的智能体可满足第一点要求,但尚无法自动满足第二点要求。因此,电子游戏测试往往仍依赖人工测试,需要人类测试者彻底试玩游戏以发现缺陷。结果,全面自动化游戏测试颇具挑战。在本研究中,我们探索利用大语言模型(LLM)的零样本能力进行电子游戏缺陷检测的可能性。通过将缺陷检测问题表述为问答任务,我们展示大语言模型能够识别游戏事件文本描述序列中哪个事件存在缺陷。为此,我们引入GameBugDescriptions基准数据集,其包含167个存在缺陷的游戏玩法视频,以及跨越8款游戏共计334个问答对。我们在该基准数据集上广泛评估了OPT与InstructGPT大语言模型族共六个模型的性能。我们的结果显示,采用语言模型检测电子游戏缺陷前景可期。借助恰当的提示技术,我们可达到70.66%的准确率,且在部分电子游戏上高达78.94%。我们的代码、评估数据与基准可见于 https://asgaardlab.github.io/LLMxBugs

关键词

引用

@article{arxiv.2210.02506,
  title  = {Large Language Models are Pretty Good Zero-Shot Video Game Bug Detectors},
  author = {Mohammad Reza Taesiri and Finlay Macklon and Yihe Wang and Hengshuo Shen and Cor-Paul Bezemer},
  journal= {arXiv preprint arXiv:2210.02506},
  year   = {2022}
}