中文

Hanabi 中用于零样本协调的 K 级推理

人工智能 2022-07-18 v1 机器学习 多智能体系统

摘要

合作多智能体设置中的标准问题设定是自我博弈(SP),其目标是训练一支协作良好的智能体团队。然而,最优 SP 策略通常包含任意约定(“握手”)且与其它独立训练的智能体或人类不兼容。后一需求最近由 Hu 等人 2020 形式化为零样本协调(ZSC)设定,并部分地由其 Other-Play(OP)算法解决,该算法在纸牌游戏 Hanabi 中展示了改进的 ZSC 与人-AI 表现。OP 假设可获取环境的对称性,并防止智能体在训练中以互不相容的方式打破这些对称性。然而,正如作者所指出的,发现给定环境的对称性是计算困难问题。相反,我们展示了通过对 k-level reasoning(KLR,k 级推理,Costa Gomes 等人 2006)进行简单适配,同步训练所有级别,我们可在 Hanabi 中获得有竞争力的 ZSC 与临时组队表现,包括在与类人代理 bot 配对时。我们还引入了一种新方法,即带最佳响应的同步 k 级推理(SyKLRBR),其通过共同训练一个最佳响应进一步提升了我们同步 KLR 的表现。

关键词

引用

@article{arxiv.2207.07166,
  title  = {K-level Reasoning for Zero-Shot Coordination in Hanabi},
  author = {Brandon Cui and Hengyuan Hu and Luis Pineda and Jakob N. Foerster},
  journal= {arXiv preprint arXiv:2207.07166},
  year   = {2022}
}

备注

Neurips 2021. 15 pages. 2 figures