从零开始的无人谈判外交游戏
机器学习
2021-10-07 v1 人工智能
计算机科学与博弈论
多智能体系统
摘要
先前 AI 在复杂游戏中的成功主要集中于每个决策点至多数百个动作的环境。相比之下,外交(Diplomacy)是一款每回合有超过 10^20 种可能动作的游戏。先前针对具有大分支因子的游戏(如 Diplomacy、StarCraft 和 Dota)的尝试,利用人类数据来引导策略或使用手工设计的奖励塑形。在本文中,我们描述了一种用于具有组合动作空间的游戏中的动作探索与均衡逼近算法。该算法在进行价值迭代的同时学习一个策略提议网络。采用双重预言(double oracle)步骤来探索额外动作以加入策略提议中。在每个状态下,模型训练的目标状态值与策略通过均衡搜索过程计算。利用该算法,我们为一个流行的双人变体 Diplomacy 完全从零训练了一个智能体 DORA,并展示其达到了超人类性能。此外,我们将方法扩展到全规模无谈判(no-press)Diplomacy,并首次在无需人类数据的情况下从零训练智能体。我们给出的证据表明,该智能体所玩的策略与人类数据引导的智能体不相容。这首次提供了 Diplomacy 中存在多重均衡的强有力证据,并表明仅自我对弈可能不足以在 Diplomacy 中达到超人类性能。
引用
@article{arxiv.2110.02924,
title = {No-Press Diplomacy from Scratch},
author = {Anton Bakhtin and David Wu and Adam Lerer and Noam Brown},
journal= {arXiv preprint arXiv:2110.02924},
year = {2021}
}