中文

通过均衡搜索在无压力外交游戏中达到人类水平表现

人工智能 2021-05-04 v2 计算机科学与博弈论 机器学习

摘要

此前 AI 在复杂游戏中的突破集中于纯对抗或纯合作设定。相比之下,外交(Diplomacy)是一款涉及合作与竞争的联盟多变游戏。因此,外交已被证明是一个艰巨的研究挑战。本文描述一个用于无压力(no-press)变体外交游戏的智能体,它结合了基于人类数据的监督学习与通过悔恨最小化(regret minimization)的单步前瞻搜索。悔恨最小化技术曾是此前对抗游戏中 AI 成功(最著名的是扑克)背后的方法,但此前未曾在涉及合作的大规模游戏中显示出成功。我们表明,我们的智能体大幅超越过往无压力外交博弈机器人,不会被人类专家利用,且在热门外交网站上进行的匿名对局中排名位于人类玩家前 2%。

关键词

引用

@article{arxiv.2010.02923,
  title  = {Human-Level Performance in No-Press Diplomacy via Equilibrium Search},
  author = {Jonathan Gray and Adam Lerer and Anton Bakhtin and Noam Brown},
  journal= {arXiv preprint arXiv:2010.02923},
  year   = {2021}
}