中文

用于零样本协作的“他者博弈”

人工智能 2021-05-13 v3

摘要

我们考虑零样本协作问题——构建能够与未曾见过的新伙伴(例如人类)进行协作的 AI 智能体。标准的多智能体强化学习(MARL)方法通常聚焦于自博弈(SP)设定,即智能体通过反复与自身对弈来构建策略。遗憾的是,将 SP 朴素地应用于零样本协作问题会产生建立高度专门化惯例、无法迁移到未经训练的新伙伴的智能体。我们引入了一种称为他者博弈(OP)的新型学习算法,它利用底层问题中已知对称性的存在,通过寻找更鲁棒的策略来增强自博弈。我们从理论与实验两方面对 OP 进行了刻画。我们研究了合作纸牌游戏 Hanabi,表明 OP 智能体在与独立训练的智能体配对时获得了更高分数。在初步结果中,我们还表明与最先进的 SP 智能体相比,我们的 OP 智能体在与人类玩家配对时获得了更高的平均分数。

关键词

引用

@article{arxiv.2003.02979,
  title  = {"Other-Play" for Zero-Shot Coordination},
  author = {Hengyuan Hu and Adam Lerer and Alex Peysakhovich and Jakob Foerster},
  journal= {arXiv preprint arXiv:2003.02979},
  year   = {2021}
}