中文

无通讯外交:多智能体博弈建模

人工智能 2019-11-21 v2 机器学习 多智能体系统

摘要

《外交》是一款七人非随机、非合作博弈,智能体通过合作与背叛相结合的方式获取资源。对信任与协调的依赖使《外交》成为丰富环境中复杂序贯社会困境的第一个非合作多智能体基准。在本工作中,我们专注于训练一个学习玩无通讯(No Press)版本《外交》的智能体,该版本中玩家之间不存在专用通信信道。我们提出 DipNet,一种基于神经网络的 No Press 外交策略模型。该模型在一个包含超过 150,000 局人类对局的新数据集上训练。我们的模型首先通过专家轨迹的监督学习(SL)训练,随后用于初始化一个通过自博弈训练的强化学习(RL)智能体。SL 与 RL 智能体均通过击败流行的基于规则的机器人展现出最先进的 No Press 性能。

关键词

引用

@article{arxiv.1909.02128,
  title  = {No Press Diplomacy: Modeling Multi-Agent Gameplay},
  author = {Philip Paquette and Yuchen Lu and Steven Bocco and Max O. Smith and Satya Ortiz-Gagne and Jonathan K. Kummerfeld and Satinder Singh and Joelle Pineau and Aaron Courville},
  journal= {arXiv preprint arXiv:1909.02128},
  year   = {2019}
}

备注

Accepted at NeurIPS 2019