中文

视觉语言模型能否在行动角色扮演游戏中发挥作用?以《黑妖·悟空》为研究案例

人工智能 2024-09-24 v2

摘要

最近,基于大语言模型(LLM)的智能体在 various 领域取得了显著进展。其中一个最受欢迎的研究领域是将这些智能体应用于视频游戏。传统方法依赖游戏 API 访问游戏环境和操作数据,但这受限于 API 的可用性,且不反映人类游戏玩法。随着视觉语言模型(VLMs)的出现,智能体拥有了增强的视觉理解能力,能够仅通过视觉输入与游戏交互。尽管已有进展,当前方法在 action-oriented 任务中仍面临挑战,尤其是在行动角色扮演游戏(ARPGs)中,强化学习方法普遍但泛化性差且需要大量训练。为解决这些限制,我们选取一款 ARPG《黑妖·悟空》作为研究平台,探讨现有 VLMs 在仅视觉输入和复杂 action 输出场景中的能力边界。我们定义游戏内 12 个任务,其中 75% 聚焦战斗,并将多个最先进的 VLMs 纳入该基准测试。此外,我们将发布包含 recorded gameplay 视频和操作日志(包括鼠标和键盘操作)的人类操作数据集。我们提出一种新型 VARP(视觉-行动角色扮演)智能体框架,包括 action 规划系统和视觉轨迹系统。我们的框架能够完成基础任务,在 easy 和 medium 难度的战斗场景中成功率达 90%。本研究旨为在复杂 action 游戏环境中应用多模态智能体提供新见解和方向。代码和数据集将在 https://varp-agent.github.io/ 公开。

关键词

引用

@article{arxiv.2409.12889,
  title  = {Can VLMs Play Action Role-Playing Games? Take Black Myth Wukong as a Study Case},
  author = {Peng Chen and Pi Bu and Jun Song and Yuan Gao and Bo Zheng},
  journal= {arXiv preprint arXiv:2409.12889},
  year   = {2024}
}