中文

LLM 可能不是人类水平的玩家,但它们可以是测试者:基于 LLM 代理测量游戏难度

人工智能 2024-10-07 v1 人机交互 机器学习

摘要

最近的大语言模型(LLM)进展表明其作为各种任务的自主代理具有潜力。其中一种新兴应用是利用 LLM 进行游戏。本文探讨了游戏行业的一个实际问题:LLM 能否用于测量游戏难度?我们提出一种通用游戏测试框架,使用 LLM 代理进行测试,并在两个广泛玩法的策略游戏(Wordle 和 Slay the Spire)上进行测试。我们的结果揭示了有趣的发现:尽管 LLM 在性能上可能不如平均人类玩家,但其在运用简单、通用提示技术引导下的表现,与人类玩家指示的难度呈统计学显著且高度相关。这表明 LLM 可作为开发过程中测量游戏难度的有效代理。基于我们的实验,我们还概述了将 LLM 纳入游戏测试流程的通用原则和指南。

关键词

引用

@article{arxiv.2410.02829,
  title  = {LLMs May Not Be Human-Level Players, But They Can Be Testers: Measuring Game Difficulty with LLM Agents},
  author = {Chang Xiao and Brenda Z. Yang},
  journal= {arXiv preprint arXiv:2410.02829},
  year   = {2024}
}