中文

AvalonBench:评估游玩阿瓦隆游戏的大语言模型

人工智能 2023-11-09 v3 计算与语言

摘要

本文中,我们探索了大型语言模型(LLMs)智能体在游玩策略性社交推理游戏《抵抗组织:阿瓦隆》中的潜力。阿瓦隆中的玩家不仅需要根据动态演化的游戏阶段作出明智决策,还需参与讨论,在讨论中必须对其他玩家进行欺骗、推理与协商。这些特性使阿瓦隆成为一个引人注目的测试平台,用于研究LLM智能体的决策与语言处理能力。为推进此方向的研究,我们引入了AvalonBench——一个专为评估多智能体LLM智能体而量身打造的综合游戏环境。该基准包含:(1)阿瓦隆的游戏环境,(2)作为基线对手的基于规则的机器人,以及(3)为每个角色配备定制提示的ReAct风格LLM智能体。值得注意的是,我们基于AvalonBench的评估凸显了清晰的能力差距。例如,在对抗扮演邪恶方的基于规则的机器人时,ChatGPT扮演好方角色的胜率为22.2%,而同一设定下好方机器人取得了38.2%的胜率。我们设想AvalonBench可成为一个良好的测试平台,用于开发更先进的LLMs(通过自对弈)与智能体框架,以有效建模此类游戏环境中分层的复杂性。

关键词

引用

@article{arxiv.2310.05036,
  title  = {AvalonBench: Evaluating LLMs Playing the Game of Avalon},
  author = {Jonathan Light and Min Cai and Sheng Shen and Ziniu Hu},
  journal= {arXiv preprint arXiv:2310.05036},
  year   = {2023}
}