中文

使用LLM玩NetHack:作为零样本智能体的潜力与局限

人工智能 2024-03-04 v1

摘要

大型语言模型(LLM)作为零样本游戏智能体的高层规划器已展现出巨大成功。然而,这些智能体主要是在Minecraft上进行评估,其中长期规划相对简单。相比之下,在动态机器人环境中测试的智能体由于环境简单(仅有少量物体和交互)而面临限制。为了填补文献中的这一空白,我们提出了NetPlay,这是首个针对具有挑战性的roguelike游戏NetHack的LLM驱动的零样本智能体。NetHack因其多样化的物品和怪物、复杂的交互以及多种死亡方式而成为一个特别具有挑战性的环境。NetPlay采用了一种为动态机器人环境设计的架构,并针对NetHack进行了修改。与之前的方法类似,它提示LLM从预定义的技能中选择,并跟踪过去的交互以增强决策。鉴于NetHack的不可预测性,NetPlay检测重要游戏事件以中断正在运行的技能,从而使其能够对意外情况做出反应。虽然NetPlay在与NetHack机制的交互中表现出相当的灵活性和熟练度,但它在模糊的任务描述和缺乏明确反馈方面存在困难。我们的研究结果表明,NetPlay在提供详细上下文信息时表现最佳,这表明对于像NetHack这样的复杂游戏,需要动态方法来提供上下文信息。

关键词

引用

@article{arxiv.2403.00690,
  title  = {Playing NetHack with LLMs: Potential & Limitations as Zero-Shot Agents},
  author = {Dominik Jeurissen and Diego Perez-Liebana and Jeremy Gow and Duygu Cakmak and James Kwan},
  journal= {arXiv preprint arXiv:2403.00690},
  year   = {2024}
}