神经自动课程
人工智能
2021-11-02 v2 多智能体系统
摘要
在求解两人零和博弈时,多智能体强化学习(MARL)算法通常构建智能体种群,在每次迭代中,将针对对手种群混合的最佳响应发现为一个新智能体。在此类过程中,“与谁竞争”(即对手混合)和“如何击败他们”(即寻找最佳响应)的更新规则由虚构博弈和 Double Oracle 等人工开发的博弈论原理支撑。本文引入一种新颖框架——神经自动课程(NAC)——利用元梯度下降自动发现学习更新规则,无需显式人工设计。具体而言,我们用神经网络参数化对手选择模块,用优化子程序参数化最佳响应模块,并仅通过与博弈引擎的交互来更新其参数,其中双方均旨在最小化其可利用性。令人惊讶的是,即使没有人工设计,所发现的 MARL 算法在技巧博弈、可微 Lotto、非传递混合博弈、迭代匹配便士和 Kuhn Poker 上取得了与最先进的基于种群的博弈求解器(如 PSRO)相当甚至更好的性能。此外,我们表明 NAC 能够从小型博弈泛化到大型博弈,例如在 Kuhn Poker 上训练并在 Leduc Poker 上超越 PSRO。我们的工作启发了一个有前景的未来方向,即仅从数据中发现通用的 MARL 算法。
引用
@article{arxiv.2106.02745,
title = {Neural Auto-Curricula},
author = {Xidong Feng and Oliver Slumbers and Ziyu Wan and Bo Liu and Stephen McAleer and Ying Wen and Jun Wang and Yaodong Yang},
journal= {arXiv preprint arXiv:2106.02745},
year = {2021}
}
备注
corresponding to <[email protected]>