中文

通过人类正则化强化学习与规划掌握无通信外交博弈

计算机科学与博弈论 2022-10-12 v1 人工智能 机器学习 多智能体系统

摘要

无通信外交是一种包含合作与竞争的复杂策略博弈,一直作为多智能体 AI 研究的基准。尽管自博弈强化学习在象棋、围棋和扑克等纯对抗博弈中取得了诸多成功,但仅靠自博弈不足以在涉及与人类合作的领域实现最优性能。我们通过首先引入一种我们称为 DiL-piKL 的规划算法来解决这一缺陷,该算法将奖励最大化策略向人类模仿学习策略进行正则化。我们证明在修改的效用函数下,这是一种无悔学习算法。我们随后表明,DiL-piKL 可以扩展为我们称为 RL-DiL-piKL 的自博弈强化学习算法,该算法提供了人类对弈的模型,同时训练出能对该人类模型做出良好响应的智能体。我们使用 RL-DiL-piKL 训练了一个命名为 Diplodocus 的智能体。在一场包含 62 名涵盖从初学者到专家各技能水平的人类参与者的 200 局无通信外交锦标赛中,两个 Diplodocus 智能体的平均得分均高于所有参与超过两局的其他参与者,并根据 Elo 评级模型分别排名第一和第三。

关键词

引用

@article{arxiv.2210.05492,
  title  = {Mastering the Game of No-Press Diplomacy via Human-Regularized Reinforcement Learning and Planning},
  author = {Anton Bakhtin and David J Wu and Adam Lerer and Jonathan Gray and Athul Paul Jacob and Gabriele Farina and Alexander H Miller and Noam Brown},
  journal= {arXiv preprint arXiv:2210.05492},
  year   = {2022}
}