LLM 可能不是人类水平的玩家,但它们可以是测试者:基于 LLM 代理测量游戏难度
人工智能
2024-10-07 v1 人机交互
机器学习
摘要
最近的大语言模型(LLM)进展表明其作为各种任务的自主代理具有潜力。其中一种新兴应用是利用 LLM 进行游戏。本文探讨了游戏行业的一个实际问题:LLM 能否用于测量游戏难度?我们提出一种通用游戏测试框架,使用 LLM 代理进行测试,并在两个广泛玩法的策略游戏(Wordle 和 Slay the Spire)上进行测试。我们的结果揭示了有趣的发现:尽管 LLM 在性能上可能不如平均人类玩家,但其在运用简单、通用提示技术引导下的表现,与人类玩家指示的难度呈统计学显著且高度相关。这表明 LLM 可作为开发过程中测量游戏难度的有效代理。基于我们的实验,我们还概述了将 LLM 纳入游戏测试流程的通用原则和指南。
引用
@article{arxiv.2410.02829,
title = {LLMs May Not Be Human-Level Players, But They Can Be Testers: Measuring Game Difficulty with LLM Agents},
author = {Chang Xiao and Brenda Z. Yang},
journal= {arXiv preprint arXiv:2410.02829},
year = {2024}
}