Any-Play:一种用于零样本协作的固有增强方法
人工智能
2022-02-01 v1 机器学习
多智能体系统
摘要
在协作任务中具备人类或超人类水平的协作人工智能正处于机器学习研究的前沿。先前的工作往往在与现实脱节的自博弈(由共同训练的智能体组成的团队)和交叉博弈(独立训练但使用相同算法的智能体组成的团队)等限制性范式下评估协作 AI 性能。近期研究表明,针对这些狭隘设定优化的 AI 在真实世界中可能是不尽如人意的协作者。我们形式化了一种评估协作 AI 的替代准则,称为算法间交叉博弈(inter-algorithm cross-play),即智能体在与实验池中所有其他智能体组队表现上进行评估,且不假设智能体间存在算法相似性。我们表明,现有的最先进协作 AI 算法,如 Other-Play 和 Off-Belief Learning,在该范式下表现不佳。我们提出了 Any-Play 学习增强——一种基于多样性的内在奖励用于零样本协作(ZSC)的多智能体扩展——将基于自博弈的算法推广到算法间交叉博弈设定。我们将 Any-Play 学习增强应用于简化动作解码器(SAD),并在协作纸牌游戏 Hanabi 中展示了最先进的性能。
引用
@article{arxiv.2201.12436,
title = {Any-Play: An Intrinsic Augmentation for Zero-Shot Coordination},
author = {Keane Lucas and Ross E. Allen},
journal= {arXiv preprint arXiv:2201.12436},
year = {2022}
}
备注
Accepted to AAMAS 2022. Code will be made available at https://github.com/mit-ll/hanabi_AnyPlay (may take several weeks after posting of this pre-print)