通过人类正则化强化学习与规划掌握无通信外交博弈
计算机科学与博弈论
2022-10-12 v1 人工智能
机器学习
多智能体系统
摘要
无通信外交是一种包含合作与竞争的复杂策略博弈,一直作为多智能体 AI 研究的基准。尽管自博弈强化学习在象棋、围棋和扑克等纯对抗博弈中取得了诸多成功,但仅靠自博弈不足以在涉及与人类合作的领域实现最优性能。我们通过首先引入一种我们称为 DiL-piKL 的规划算法来解决这一缺陷,该算法将奖励最大化策略向人类模仿学习策略进行正则化。我们证明在修改的效用函数下,这是一种无悔学习算法。我们随后表明,DiL-piKL 可以扩展为我们称为 RL-DiL-piKL 的自博弈强化学习算法,该算法提供了人类对弈的模型,同时训练出能对该人类模型做出良好响应的智能体。我们使用 RL-DiL-piKL 训练了一个命名为 Diplodocus 的智能体。在一场包含 62 名涵盖从初学者到专家各技能水平的人类参与者的 200 局无通信外交锦标赛中,两个 Diplodocus 智能体的平均得分均高于所有参与超过两局的其他参与者,并根据 Elo 评级模型分别排名第一和第三。
引用
@article{arxiv.2210.05492,
title = {Mastering the Game of No-Press Diplomacy via Human-Regularized Reinforcement Learning and Planning},
author = {Anton Bakhtin and David J Wu and Adam Lerer and Jonathan Gray and Athul Paul Jacob and Gabriele Farina and Alexander H Miller and Noam Brown},
journal= {arXiv preprint arXiv:2210.05492},
year = {2022}
}